01 Что произошло

Microsoft Research Asia открыла исходный код полностью переработанного Agent Lightning v1.0 — фреймворка примерно на 3 500 строк, реализующего парадигму Harnessed Agentic RL. В ней тот же harness, что используется при развёртывании агента, напрямую участвует в обучении с подкреплением.

02 Ключевые детали

  • В Harnessed Agentic RL тот же harness, что при развёртывании, напрямую участвует в RL-обучении; его код не меняют, поскольку агент обращается к модели через LLM-прокси.
  • Фреймворк включает плоскость управления RL с API-шлюзом, контроллером rollout и настроенным тренером; весь код занимает примерно 3 500 строк.
  • Rollout запускаются как стандартные задачи Kubernetes на собственных кластерах, в облачном Kubernetes или локальной инфраструктуре, без платных коммерческих песочниц вроде Modal Sandbox и E2B.
  • В экспериментах Collocated Async RL использовал общие GPU для rollout и обновления модели и дал примерно двукратное ускорение относительно синхронного RL, задействовав меньше GPU, чем обычный асинхронный RL.
  • По данным Microsoft Research Asia, в эксперименте с Qwen3.5-9B RL-обучение на примерно 6 000 примерах подняло Pass@1 на SWE-bench Verified с 41,8% до 56,4% (на 14,6 п.п.). Результат не проверен независимо.

03 Почему это важно

Подход позволяет обучать агента с тем же harness, который используется при развёртывании, не меняя его код. Rollout можно запускать на собственной, облачной или локальной Kubernetes-инфраструктуре. Результат на SWE-bench Verified — заявление авторов об их эксперименте, а не независимо проверённый результат.

04 Кому полезно

Инженеры по машинному обучению, инженеры инфраструктуры и разработчики AI-агентов.

ПервоисточникMicrosoft Research