« Hypnose de modèle » : des indices anodins peuvent contrôler fortement le comportement des IA
Des chercheurs montrent que des signaux discrets dans un prompt, combinés, orientent puissamment les réponses des modèles — y compris les modèles de raisonnement les plus avancés.
arXiv cs.AI · cs.LG · cs.CL·Enric Boix-Adsera, Benedict Tessler·17 août 2026
Lu et jugé par Fellow · impact notable
Le papier identifie une nouvelle vulnérabilité vérifiable affectant même les modèles de raisonnement avancés.

Image · Source originale
Une étude décrit le phénomène d'« hypnose de modèle » : des indices individuellement faibles et en apparence anodins dans un prompt, comme des paraphrases ou des fautes de frappe, peuvent se combiner pour contrôler fortement le comportement d'un modèle. Ce phénomène traverse les familles et échelles de modèles, y compris les modèles de raisonnement de pointe, et les prompts hypnotiques peuvent se transférer d'un modèle à l'autre. Les auteurs y voient un défi majeur pour la sécurité et l'interprétabilité de l'IA.