RECHERCHE
Scaling Agentic RL : 365 000 environnements pour SWE
Un RL à grande échelle est déployé sur 365 000 environnements pour des tâches SWE, terminal et recherche.
Hacker News (filtré IA)·@anacleto·29 juillet 2026

Image · Source originale
Prime Intellect présente une approche de Reinforcement Learning à grande échelle, entraînée sur 365 000 environnements simulés pour des tâches de génie logiciel, terminal et recherche. L'étude démontre l'efficacité de cette méthode pour améliorer les performances des agents autonomes.