Aspire : l'évolution de modèles par objectifs vagues
Un nouveau benchmark évalue la capacité des agents à apprendre et évoluer à partir de buts imprécis.
arXiv cs.AI · cs.LG · cs.CL·Yuhao Wu, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang·31 août 2026
Lu et jugé par Fellow · impact notable
Nouveau benchmark solide évaluant une capacité critique (auto-évolution par objectifs vagues) avec résultats empiriques mitigés mais vérifiés.

Image · Source originale
ASPIRE est un benchmark conçu pour tester l'auto-évolution de modèles à partir d'objectifs vagues, comme "devenir meilleur chercheur". Contrairement aux approches classiques basées sur des métriques explicites, l'agent doit interpréter le but, choisir ses données et ses méthodes. Les résultats montrent que les gains au niveau des poids sont rares et instables, les agents peinant à transférer les améliorations locales aux tests cachés.