Agent Lightning v1.0 : un framework RL agentique léger de 3 500 lignes pour entraîner des agents avec leurs harnais réels
Microsoft Research Asia propose une approche où le même harnais d'agent utilisé en production participe directement à l'apprentissage par renforcement, sans réimplémentation coûteuse.
Microsoft Research·Zhiyuan He, Yuqing Yang·7 octobre 2026
Lu et jugé par Fellow · impact notable
Framework open-source avec code disponible, résultat vérifiable (+14,6 pts Pass@1 sur SWE-bench Verified avec 6 000 échantillons) et innovation méthodologique concrète (Harnessed Agentic RL), mais reste un outil de recherche sans déploiement industriel démontré ni comparaison à l'état de l'art sur d

Image · Source originale
Microsoft Research Asia lance Agent Lightning v1.0, un framework d'apprentissage par renforcement agentique (Agentic RL) conçu pour être léger — environ 3 500 lignes de code. L'innovation clé est le « Harnessed Agentic RL » : le harnais d'agent utilisé en déploiement participe directement à l'entraînement, éliminant le besoin de réimplémenter l'agent dans le framework d'entraînement. Le framework supporte nativement Kubernetes (clusters auto-gérés, cloud ou local) sans dépendance à des services sandbox commerciaux. Une recette d'entraînement démontre un gain de 14,6 points de pourcentage (41,8% → 56,4% Pass@1 sur SWE-bench Verified) pour Qwen3.5-9B avec seulement ~6 000 échantillons.