Toutes les news taguées avec ce sujet.
Une nouvelle méthode généralise l'auto-distillation on-policy en introduisant un paramètre β pour équilibrer stabilité et performance.
Un RL à grande échelle est déployé sur 365 000 environnements pour des tâches SWE, terminal et recherche.