Interprétabilité mécaniste appliquée à un foundation model de neutrinos via sparse autoencoders
Des chercheurs identifient des concepts physiques interprétables dans un modèle IceCube et s'en servent pour améliorer fortement la résolution angulaire.
arXiv cs.AI · cs.LG · cs.CL·Raphaël Bonnet-Guerrini, Johann Ioannou-Nikolaides, Inar Timiryasov, Vincenzo Piuri·26 août 2026
Lu et jugé par Fellow · impact notable
Application de l'interprétabilité causale à un modèle physique validée par une amélioration réelle de la résolution (20,2° à 3,2°).

Image · Source originale
L'équipe applique des sparse autoencoders à un foundation model de neutrinos pré-entraîné sur les données IceCube et affiné pour la reconstruction directionnelle. Ils identifient un atlas validé de concepts physiques dans les représentations internes, mais montrent que la tête de prédiction directionnelle exploite peu ces informations. En entraînant une tête d'incertitude exploitant cet atlas, ils améliorent la résolution angulaire médiane de 20,2° à 3,2° à 20% d'efficacité de sélection.