01 Что произошло
Microsoft Research Asia открыла исходный код полностью переработанного Agent Lightning v1.0 — фреймворка примерно на 3 500 строк, реализующего парадигму Harnessed Agentic RL. В ней тот же harness, что используется при развёртывании агента, напрямую участвует в обучении с подкреплением.
02 Ключевые детали
- В Harnessed Agentic RL тот же harness, что при развёртывании, напрямую участвует в RL-обучении; его код не меняют, поскольку агент обращается к модели через LLM-прокси.
- Фреймворк включает плоскость управления RL с API-шлюзом, контроллером rollout и настроенным тренером; весь код занимает примерно 3 500 строк.
- Rollout запускаются как стандартные задачи Kubernetes на собственных кластерах, в облачном Kubernetes или локальной инфраструктуре, без платных коммерческих песочниц вроде Modal Sandbox и E2B.
- В экспериментах Collocated Async RL использовал общие GPU для rollout и обновления модели и дал примерно двукратное ускорение относительно синхронного RL, задействовав меньше GPU, чем обычный асинхронный RL.
- По данным Microsoft Research Asia, в эксперименте с Qwen3.5-9B RL-обучение на примерно 6 000 примерах подняло Pass@1 на SWE-bench Verified с 41,8% до 56,4% (на 14,6 п.п.). Результат не проверен независимо.
03 Почему это важно
Подход позволяет обучать агента с тем же harness, который используется при развёртывании, не меняя его код. Rollout можно запускать на собственной, облачной или локальной Kubernetes-инфраструктуре. Результат на SWE-bench Verified — заявление авторов об их эксперименте, а не независимо проверённый результат.
04 Кому полезно
Инженеры по машинному обучению, инженеры инфраструктуры и разработчики AI-агентов.