La fragilité des agents auto-améliorants : variance, ordre des tâches et sous-spécification
Une réévaluation montre que les agents à mémoire textuelle progressent surtout grâce à l'ordre des tâches, pas à une réelle amélioration.
arXiv cs.AI · cs.LG · cs.CL·Qinyuan Ye, Yu Li, Yada Pruksachatkun, Jiaxin Zhang·18 août 2026
Lu et jugé par Fellow · impact notable
Réévaluation rigoureuse d'une méthode prometteuse, identifiant des défauts méthodologiques majeurs (variance, ordre des tâches) avec code et données fournis.

Image · Source originale
Les auteurs réévaluent deux méthodes d'agents auto-améliorants basés sur une mémoire textuelle, en ajoutant des runs multiples et un mélange aléatoire des tâches. Ils montrent que l'évaluation est très bruitée et que l'amélioration observée dépend fortement de l'ordre des tâches, souvent imposé implicitement dans les travaux précédents. La sous-spécification des tâches et environnements apparaît comme une cause majeure, partiellement corrigée par des rubriques détaillées et un feedback environnemental.