01 发生了什么

微软亚洲研究院开源了完全重建的 Agent Lightning v1.0。这一约 3500 行代码的框架实现了 Harnessed Agentic RL 范式:部署时使用的同一个 agent harness 直接参与强化学习训练。

02 关键细节

  • Harnessed Agentic RL 将部署时使用的 harness 直接用于 RL 训练;现有 harness 代码保持不变,智能体通过 LLM 代理访问模型。
  • 框架的 RL 控制平面包括 API 网关、rollout 控制器和定制训练器,整体约 3500 行代码。
  • Rollout 以标准 Kubernetes 作业运行,可使用自管集群、云端 Kubernetes 或本地基础设施,无需依赖 Modal Sandbox、E2B 等付费商业沙箱。
  • 实验中,Collocated Async RL 让 rollout 与模型更新共用 GPU;相比同步 RL,端到端速度约提高两倍,使用的 GPU 少于传统异步 RL。
  • 微软亚洲研究院报告称,在 Qwen3.5-9B 实验中,使用约 6000 条样本进行 RL 训练后,SWE-bench Verified 上的 Pass@1 从 41.8% 升至 56.4%,提高 14.6 个百分点。该结果未经独立验证。

03 为什么重要

团队可以用部署时采用的同一个 harness 训练智能体,无需修改现有代码。Rollout 可运行在自管、云端或本地 Kubernetes 基础设施上。SWE-bench Verified 的结果来自作者报告的实验,未经独立验证。

04 适合谁

机器学习工程师、基础设施工程师及人工智能代理开发人员。