Interprétabilité IA par distillation locale
Une méthode de distillation locale permet de rendre les modèles boîte noire interprétables sans perte de précision.
arXiv cs.AI · cs.LG · cs.CL·Erin Craig, Yiling Huang, Snigdha Panigrahi·24 août 2026
Lu et jugé par Fellow · impact notable
Méthode vérifiée sur 17 benchmarks offrant une interprétabilité locale sans perte de précision significative.

Image · Source originale
Cette étude présente la distillation locale, où un modèle enseignant boîte noire guide un modèle linéaire élève régularisé pour chaque point de requête. La méthode définit la localité en surpondérant les observations similaires et ancre l'ajustement sur la prédiction de l'enseignant. L'interprétabilité est assurée par une randomisation gaussienne pour évaluer la stabilité des caractéristiques. Sur 17 benchmarks, la méthode égale quasiment la précision du modèle enseignant.