S3Gym : évaluation de l'auto-amélioration des LLM
Un nouveau benchmark teste si les agents peuvent apprendre de leurs propres erreurs.
arXiv cs.AI · cs.LG · cs.CL·Jiajun Shi, Siyuan Tao, Yuhao Wu, Zexuan Wang·31 août 2026
Lu et jugé par Fellow · impact léger
Nouveau benchmark diagnostique sans coverage indépendante ni adoption démontrée, portée limitée à 7 jeux textuels.

Image · Source originale
S3Gym est un benchmark interactif évaluant la capacité des LLM à s'auto-améliorer via trois mécanismes : auto-test, auto-jugement et auto-amélivement. Les expériences sur sept jeux textuels montrent que l'amélioration n'est ni automatique ni uniforme, dépendant fortement de la structure des tâches. L'efficacité varie entre l'utilisation de l'historique brut, de mémoires résumées et de l'entraînement des paramètres.