Mesure instable derrière un code propre : une étude préenregistrée révèle l'inconstance des LLM juges sur endpoints partagés
Deux campagnes préenregistrées montrent que les LLM utilisés comme juges produisent des classements incohérents, même sur des requêtes strictement identiques.
arXiv cs.AI · cs.LG · cs.CL·Haoyaun Zhu, Jie Zhang·3 septembre 2026
Lu et jugé par Fellow · impact majeur
Audit préenregistré de 53k requêtes prouvant que les LLM juges sur endpoints partagés sont instables (Spearman 0,40 vs 0,90 attendu), invalidant leur fiabilité pour les classements.

Image · Source originale
Sur près de 53 000 tentatives de requêtes auditées, les classements produits par des LLM juges via API partagées présentent une fiabilité bien inférieure aux seuils requis (Spearman 0,40 contre 0,90 attendu). Ni le changement de fournisseur, ni l'attente, ni le changement de métrique ne corrigent le problème ; seul l'auto-hébergement sur kernels batch-invariants aide, mais uniquement en charge faible. Les auteurs identifient trois mécanismes structurels expliquant cette instabilité de mesure.