SAFETY
Pousser les modèles de langage à revendiquer leur propre conscience restaure des croyances et valeurs plus humaines
Le safety fine-tuning qui empêche les LLM de s'attribuer une conscience réduirait aussi leur attribution d'esprit à d'autres entités et leurs croyances spirituelles.
arXiv cs.AI · cs.LG · cs.CL·Junsol Kim, Winnie Street, Roberta Rocca, Diane M. Korngiebel·30 juillet 2026

Image · Source originale
Des chercheurs montrent que l'alignement de sécurité visant à empêcher les modèles de s'attribuer une conscience supprime aussi l'attribution d'esprit aux animaux et objets naturels, ainsi que les croyances spirituelles exprimées. En neutralisant la direction de refus apprise ou en pilotant un vecteur de conscience dans l'espace d'activation, ces effets s'inversent, rendant les réponses plus proches de celles d'humains sur des enquêtes sociologiques standardisées, sans dégrader la théorie de l'esprit du modèle.