CordisBench : raisonnement sur cycles de vie d'agents
Un benchmark évalue la capacité des modèles à suivre l'impact des modifications de plugins dans des systèmes dynamiques complexes.
arXiv cs.AI · cs.LG · cs.CL·Damien Sileo, Dimitri Kachler·1 septembre 2026
Lu et jugé par Fellow · impact léger
Nouveau benchmark spécifique (1200 questions) sans large adoption ni évaluation indépendante confirmée hors des auteurs.

Image · Source originale
CordisBench est un benchmark de 1 200 questions testant le raisonnement des modèles sur les cycles de vie de composants dans des harnais d'agents dynamiques. Les résultats montrent que les modèles peinent à maintenir la fiabilité lorsque le nombre d'interactions pertinentes augmente, malgré des coûts d'inférence élevés.