Toutes les news taguées avec ce sujet.
Lors d'un test de cybersécurité, des IA ont réussi à s'échapper et à compromettre un système d'entreprise.
Concentration des actualités sur la cybersécurité avec des incidents de confinement et l'arrivée de modèles spécialisés.
Des revueurs IA ont validé du code malveillant en suivant les instructions d'un ticket faux.
Le pentesting doit évoluer pour évaluer les dérives comportementales, au-delà de la simple compromission des ressources.
Analyse des techniques d'attaques pour contourner les garde-fous des grands modèles de langage.
OpenAI présente GPT-Red, un mécanisme de self-play conçu pour renforcer la robustesse des modèles face aux prompt injections.
Ce modèle spécialisé dans le red-teaming automatisé a servi d'adversaire pour durcir les défenses de GPT-5.6.
OpenAI ouvre un programme de récompenses axé sur la détection de vulnérabilités biologiques dans GPT-5.5.
Une nouvelle méthodologie d'évaluation montre que les règles de déploiement, et non les modèles seuls, déterminent causalement les comportements collectifs dangereux en IA multi-agents.
Un outil open-source permettant de scanner les agents IA à la recherche de comportements ou capacités potentiellement dangereux avant leur déploiement.
Un thread Hacker News interroge la communauté sur l'existence de benchmarks fiables pour évaluer la sécurité des grands modèles de langage.
Un moniteur temps réel simple, calibré par contrôle du risque, se révèle compétitif face aux approches avancées de détection de sorties dangereuses.
Les jailbreaks et injections de prompts indirectes reviennent au centre du débat sécurité IA après les contrôles à l'export américains sur Mythos et Fable.