01 发生了什么
微软亚洲研究院开源了完全重建的 Agent Lightning v1.0。这一约 3500 行代码的框架实现了 Harnessed Agentic RL 范式:部署时使用的同一个 agent harness 直接参与强化学习训练。
02 关键细节
- Harnessed Agentic RL 将部署时使用的 harness 直接用于 RL 训练;现有 harness 代码保持不变,智能体通过 LLM 代理访问模型。
- 框架的 RL 控制平面包括 API 网关、rollout 控制器和定制训练器,整体约 3500 行代码。
- Rollout 以标准 Kubernetes 作业运行,可使用自管集群、云端 Kubernetes 或本地基础设施,无需依赖 Modal Sandbox、E2B 等付费商业沙箱。
- 实验中,Collocated Async RL 让 rollout 与模型更新共用 GPU;相比同步 RL,端到端速度约提高两倍,使用的 GPU 少于传统异步 RL。
- 微软亚洲研究院报告称,在 Qwen3.5-9B 实验中,使用约 6000 条样本进行 RL 训练后,SWE-bench Verified 上的 Pass@1 从 41.8% 升至 56.4%,提高 14.6 个百分点。该结果未经独立验证。
03 为什么重要
团队可以用部署时采用的同一个 harness 训练智能体,无需修改现有代码。Rollout 可运行在自管、云端或本地 Kubernetes 基础设施上。SWE-bench Verified 的结果来自作者报告的实验,未经独立验证。
04 适合谁
机器学习工程师、基础设施工程师及人工智能代理开发人员。