Toutes les news taguées avec ce sujet.
Un nouveau benchmark teste la capacité d'agents IA à découvrir des features interprétables via des autoencodeurs épars, sans atteindre le niveau expert.
Des chercheurs identifient des concepts physiques interprétables dans un modèle IceCube et s'en servent pour améliorer fortement la résolution angulaire.
Un nouveau framework injecte des directions de décodeur SAE dans un LLM pour produire directement des explications en langage naturel des features apprises.
Une étude montre que les ensembles de latents actifs des SAE ne reflètent pas mieux les catégories humaines que les embeddings denses classiques.