SHE : Évolution de harnais de sécurité pour agents LLM
Un framework apprend des limites sûres évolutives depuis des trajectoires pour sécuriser les agents LLM.
arXiv cs.AI · cs.LG · cs.CL·Wanying Qu, Qinghua Mao, Yu Li, Jiyao Liu·10 août 2026

Image · Source originale
SHE est un framework qui fait évoluer le harnais des agents LLM en décomposant les fonctions de sécurité. Il apprend à partir des trajectoires d'échec pour affiner les règles, prompts et politiques d'outils. Les tests montrent une réduction de 3,1x du taux de réussite d'attaque (ASR) sans perte d'utilité.