Au-delà du sac de features : instabilité des ensembles dans les autoencodeurs épars
Une étude montre que les ensembles de latents actifs des SAE ne reflètent pas mieux les catégories humaines que les embeddings denses classiques.
arXiv cs.AI · cs.LG · cs.CL·Nikolai Bolik, Lennart Stöpler, Artur Andrzejak·11 août 2026

Image · Source originale
Les auteurs réexaminent une analyse antérieure sur la correspondance entre représentations des LLM et catégories humaines, en utilisant le chevauchement d'ensembles de latents actifs de sparse autoencoders (SAE) comme mesure de similarité. Ils constatent que ces ensembles ne capturent pas mieux les frontières catégorielles ou la typicité humaine que les embeddings denses, et suivent plutôt la structure interne du modèle. Des modifications sémantiques contrôlées révèlent un décalage important entre jugements humains de changement conceptuel et variation des ensembles SAE actifs, suggérant que les features SAE ne composent pas selon une simple sémantique de type sac-de-features.