PAST-Bench : un benchmark pour évaluer l'auto-amélioration récursive des agents IA personnels
Un nouveau banc d'essai teste si les agents IA s'améliorent vraiment en exploitant leur expérience accumulée entre sessions.
arXiv cs.AI · cs.LG · cs.CL·Shuhan Xue, Zixin Ding, Yichen Shen, Yinjie Wang·4 août 2026

Image · Source originale
PAST-Bench évalue 26 scénarios et 204 épisodes pour mesurer si les agents personnels progressent grâce à la mémoire retenue. Testé sur sept modèles de base et quatre frameworks, les gains existent mais sont inégaux selon les capacités. Les chercheurs proposent Hermes+, une extension avec cinq interventions ciblées qui améliore les gains moyens et la traçabilité du processus d'apprentissage.