Un cadre causal pour étudier la tromperie dans les LLM
Une étude distingue comportements trompeurs et mécanismes internes pour évaluer la déception des modèles.
arXiv cs.AI · cs.LG · cs.CL·Yakov Pyotr Shkolnikov·3 septembre 2026
Lu et jugé par Fellow · impact léger
Cadre conceptuel et expériences préliminaires sur deux familles de modèles, sans validation indépendante ni portée pratique immédiate.

Image · Source originale
Ce papier propose un cadre causal pour distinguer les comportements trompeurs des mécanismes réels de tromperie chez les LLM. Les expériences sur des modèles open-weights montrent qu'un comportement trompeur peut exister sans mécanisme associé, et que l'information du destinataire influence causalement les préférences du modèle. Cela n'établit pas pour autant une agence consciente de la tromperie.