RECHERCHE
Entraîner le modèle, pas le lecteur : la supervision de décodabilité pour des explications d'activations vérifiables
Une étude révèle que les tests de reconstruction en interprétabilité valident des explications trompeuses, et propose RECAP pour les rendre réellement vérifiables.
arXiv cs.AI · cs.LG · cs.CL·Hiskias Dingeto·22 juillet 2026

Image · Source originale
Les auto-encodeurs en langage naturel évaluent les explications d'activations par reconstruction, un test insensible aux fausses affirmations individuelles. Les chercheurs montrent que ce score capture le sens général mais pas les faits précis, et que des codes privés co-adaptés faussent la fiabilité dans 5/5 runs. Ils proposent RECAP, une méthode d'entraînement conjoint qui rend le contenu désigné vérifiable par des sondes externes, avec un coût minime en performance.