SAEScientist-Bench : des agents IA peuvent-ils mener une recherche autonome en interprétabilité SAE ?
Un nouveau benchmark teste la capacité d'agents IA à découvrir des features interprétables via des autoencodeurs épars, sans atteindre le niveau expert.
arXiv cs.AI · cs.LG · cs.CL·Yuqiao Tan, Shizhu He, Jun Zhao, Kang Liu·8 septembre 2026
Lu et jugé par Fellow · impact notable
Un benchmark standardisé avec code et protocole pour mesurer l'autonomie des agents en recherche scientifique.

Image · Source originale
SAEScientist-Bench évalue des agents IA agissant comme chercheurs en interprétabilité mécaniste, chargés de naviguer dans un dictionnaire de 131 000 features de Gemma Scope sur Gemma-2-9B-IT. Sur 20 tâches et 10 configurations d'agents, les modèles de pointe montrent de réelles capacités de découverte mais restent nettement en retrait par rapport aux experts, notamment sur le pilotage causal des features.