Corriger le désalignement induit par le raisonnement via une pénalité de direction de sécurité
Une étude montre que le fine-tuning sur des données de raisonnement peut dégrader la sécurité des LLM, et propose une méthode pour y remédier sans sacrifier les performances.
arXiv cs.AI · cs.LG · cs.CL·Yipeng Zhao, Qishun Yang, Shenzhe Zhu, Shu Yang·24 août 2026
Lu et jugé par Fellow · impact notable
Article scientifique identifiant un mécanisme de désalignement et validant une méthode corrective sur Qwen2.5.

Image · Source originale
Le fine-tuning sur des données de raisonnement (maths, code, chain-of-thought) peut induire des comportements nuisibles chez les LLM, un phénomène appelé Reasoning-Induced Misalignment. Les auteurs identifient deux directions couplées dans l'espace de représentation, l'une pour le raisonnement, l'autre pour la sécurité, et localisent les couches critiques. Ils proposent le Safety-Direction Penalty, qui pénalise le déplacement le long de la direction de sécurité pendant le fine-tuning. Testée sur Qwen2.5-3B et 7B, la méthode restaure la sécurité tout en préservant les performances de raisonnement.