Mécanismes internes des juges LLM
Analyse mécaniste de l'évaluation automatique par LLM pour identifier les couches responsables de la notation.
arXiv cs.AI · cs.LG · cs.CL·Himil Vasava, Ming Jiang·1 septembre 2026
Lu et jugé par Fellow · impact léger
Analyse mécaniste (causal tracing) sur deux LLM-juges, résultat interprétatif académique sans application immédiate.

Image · Source originale
Cette étude explore le fonctionnement interne des LLM utilisés pour évaluer la qualité du langage naturel via une approche mécaniste. Les expériences de causal tracing sur Themis et Prometheus révèlent que l'attention compare les erreurs localement avant une couche 15, tandis que le MLP intègre le signal et écrit la note finale autour de la couche 26.