01 Ce qui s’est passé

Microsoft Research Asia a publié en open source Agent Lightning v1.0, entièrement reconstruit : un framework d'environ 3 500 lignes qui met en œuvre son paradigme Harnessed Agentic RL. Le même harness d'agent que celui utilisé lors du déploiement participe directement au reinforcement learning pendant l'entraînement.

02 Les points essentiels

  • Avec Harnessed Agentic RL, le harness de déploiement participe directement à l'entraînement RL. Son code existant reste inchangé et l'agent accède au modèle via un proxy LLM.
  • Le plan de contrôle RL du framework comprend une passerelle API, un contrôleur de rollout et un entraîneur personnalisé, pour environ 3 500 lignes de code.
  • Les rollouts s'exécutent comme des tâches Kubernetes standard sur des clusters autogérés, Kubernetes dans le cloud ou une infrastructure locale, sans sandboxes commerciales payantes comme Modal Sandbox ou E2B.
  • Dans les expériences, Collocated Async RL a partagé les GPU entre les rollouts et les mises à jour du modèle. Il a atteint une vitesse de bout en bout environ deux fois supérieure au RL synchrone, avec moins de GPU que le RL asynchrone classique.
  • Microsoft Research Asia rapporte que, dans son expérience avec Qwen3.5-9B, le RL sur environ 6 000 échantillons a fait passer le Pass@1 sur SWE-bench Verified de 41,8 % à 56,4 % (+14,6 points). Le résultat n'a pas été vérifié indépendamment.

03 Pourquoi c’est important

Cette approche permet d'entraîner les agents avec le même harness que celui utilisé lors du déploiement, sans modifier son code. Les rollouts peuvent s'exécuter sur une infrastructure Kubernetes autogérée, dans le cloud ou locale. Le résultat sur SWE-bench Verified est rapporté par les auteurs et n'a pas été vérifié indépendamment.

04 Pour qui c’est utile

Ingénieurs en apprentissage automatique, ingénieurs infrastructure et développeurs d'agents IA.

Source originaleMicrosoft Research