AdvSim2Real : entraîner des agents web contre l'injection de prompts adaptative dans un monde web simulé
Un agent 4B co-entraîné avec un curriculum de tâches et un adversaire évolutif résiste mieux aux injections, y compris face à un modèle frontière inédit.
arXiv cs.AI · cs.LG · cs.CL·Sarim Hashmi, Mukul Ranjan, Kshitij Mishra, Mikhail Kuznetsov·6 octobre 2026
Lu et jugé par Fellow · impact léger
Méthode d'entraînement en simulateur, testée sur 150 tâches, sans évaluation indépendante ni déploiement réel au-delà de l'étude.

Image · Source originale
Les agents web sont vulnérables aux instructions malveillantes insérées dans les pages qu'ils traitent, et les défenses actuelles reposent sur des injections figées avant l'entraînement. AdvSim2Real fait co-évoluer un curriculum de tâches, un adversaire d'injection et l'agent au sein d'un monde web simulé figé, en récompensant le curriculum pour des tâches à difficulté moyenne et l'adversaire uniquement en cas d'inversion du succès. Un agent 4B ainsi entraîné gagne en capacité et en robustesse, résiste à un adversaire frontière jamais vu durant l'entraînement, et transfère ces gains vers un navigateur réel. Sur 150 tâches web, la méthode améliore le taux de réussite de 33,6 % face à cet adversaire inédit par rapport à l'agent de base.
#web-agents#prompt-injection#adversarial-training#sécurité-ia#world-model