01 Was passiert ist

Microsoft Research Asia hat den vollständig neu aufgebauten Agent Lightning v1.0 als Open Source veröffentlicht. Das Framework umfasst rund 3.500 Codezeilen und setzt das Harnessed-Agentic-RL-Paradigma um. Dabei nimmt derselbe Agent-Harness, der im Einsatz verwendet wird, direkt am Reinforcement Learning im Training teil.

02 Die wichtigsten Details

  • Bei Harnessed Agentic RL wird der Deployment-Harness direkt ins RL-Training eingebunden. Sein vorhandener Code bleibt unverändert, weil der Agent über einen LLM-Proxy auf das Modell zugreift.
  • Die RL-Kontrollebene des Frameworks umfasst API-Gateway, Rollout-Controller und angepassten Trainer und besteht aus rund 3.500 Codezeilen.
  • Rollouts laufen als standardmäßige Kubernetes-Jobs auf eigenen Clustern, in Cloud-Kubernetes oder lokaler Infrastruktur. Bezahlte kommerzielle Sandbox-Dienste wie Modal Sandbox oder E2B sind nicht erforderlich.
  • In Experimenten teilte Collocated Async RL GPUs für Rollouts und Modell-Updates. Der Ansatz erreichte etwa die doppelte End-to-End-Geschwindigkeit von synchronem RL und nutzte weniger GPUs als herkömmliches asynchrones RL.
  • Laut Microsoft Research Asia stieg im Qwen3.5-9B-Experiment der Pass@1-Wert auf SWE-bench Verified durch RL-Training mit rund 6.000 Beispielen von 41,8 auf 56,4 Prozent (plus 14,6 Prozentpunkte). Das Ergebnis wurde nicht unabhängig überprüft.

03 Warum das wichtig ist

Teams können Agenten mit demselben Harness trainieren, den sie auch im Einsatz verwenden, ohne dessen Code zu ändern. Rollouts lassen sich auf eigener, cloudbasierter oder lokaler Kubernetes-Infrastruktur ausführen. Das SWE-bench-Verified-Ergebnis stammt aus einem Experiment der Autoren und wurde nicht unabhängig überprüft.

04 Für wen es relevant ist

Ingenieure für maschinelles Lernen, Infrastruktur-Ingenieure und Entwickler von KI-Agenten.