Un seul simulateur figé ne suffit pas : l'effondrement du simulateur en RL multi-agents
Des chercheurs identifient pourquoi les politiques entraînées contre un simulateur LLM unique généralisent mal, et proposent deux correctifs efficaces.
arXiv cs.AI · cs.LG · cs.CL·Simon Yu, Nicholas Tomlin, Marwa Abdulhai, Ximing Lu·12 août 2026

Image · Source originale
L'apprentissage par renforcement multi-agents pour l'interaction humain-IA repose souvent sur un seul LLM simulant l'utilisateur, ce qui provoque un effondrement de mode et un surajustement de la politique. Les auteurs proposent Verbalized Sampling (inférence) et Co-Training (entraînement avec une population de simulateurs) pour préserver la diversité. Ces méthodes améliorent le taux de succès de 9% à 14% sur trois benchmarks, avec des gains confirmés sur utilisateurs réels. Le framework open-source SCOPE est publié.