Decoding-Level Taboo : test de stress pour la robustesse des LLM
Une méthode de diagnostic intervient dans l'espace des logits pour forcer les modèles hors de leur voie nominale et évaluer leur résilience.
arXiv cs.AI · cs.LG · cs.CL·Tadanobu Chuyo Kamijo, Ori Rottenstreich, Javier Conde, Gonzalo Martínez·10 août 2026

Image · Source originale
Les évaluations classiques masquent une divergence entre benchmarks et déploiement réel. Decoding-Level Taboo est un test de stress intervenant directement dans l'espace des logits pour forcer la circumlocution. Les résultats montrent que la robustesse hors voie dépend de l'échelle des paramètres et de l'alignement post-training.