Toutes les news taguées avec ce sujet.
Cognition annonce SWE-1.7, son nouveau modèle spécialisé en ingénierie logicielle, qui rivalise avec GPT-4.5 et Claude Opus sur les benchmarks.
Une nouvelle stratégie RL permet aux agents LLM de gérer des tâches longues sans saturer la fenêtre de contexte, avec des gains mesurables sur SWE-bench.
Un nouveau benchmark évalue les agents IA non plus sur des bugs isolés, mais sur des tâches d'ingénierie logicielle complexes, à la hauteur d'un senior.