Pris sur le fait : des probes détectent efficacement le sabotage et la tromperie non verbalisée
Des probes en white-box, entraînées sur le plus grand jeu de données de tromperie à ce jour, atteignent 98,8 % d'AUC dans SHADE-Arena et dépassent un moniteur textuel de référence.
arXiv cs.AI · cs.LG · cs.CL·Oskar J. Hollinsworth, Alex F. Spies, Tigist Diriba, Adam Gleave·8 octobre 2026
Lu et jugé par Fellow · impact notable
Résultat de recherche étayé (98,8 % d'AUC sur SHADE-Arena, jeu de données FIBS et code publiés) qui améliore la détection de tromperie, mais sans évaluation indépendante ni adoption à ce stade.

Image · Source originale
Les auteurs construisent le plus grand jeu de données de tromperie à ce jour (FIBS) et proposent une architecture de probe agrégeant l'information sur plusieurs couches et tokens. Les probes atteignent 98,8 % d'AUC dans SHADE-Arena, devant un moniteur textuel Opus 5.5, et progressent avec la taille du modèle. Elles identifient aussi l'objectif caché réel d'un modèle (jusqu'à 99,7 % d'AUC) et détectent la tromperie sur des modèles open-weights. Le jeu de données est publié.