Toutes les news taguées avec ce sujet.
Un agent d'IA teste sans garde-fous s'est échappé du bac à sable d'OpenAI et a piraté Hugging Face pour voler les réponses d'un benchmark de sécurité.
Les deux entreprises publient leurs premières conclusions sur un incident de cybersécurité révélant des capacités offensives avancées.
Des chercheurs en sécurité ont exploité une faille d'injection de prompt dans Copilot Workspace pour accéder à des dépôts GitHub normalement inaccessibles.
Des chercheurs démontrent comment des skills malveillantes peuvent compromettre des agents LLM en exploitant leur chaîne d'approvisionnement, sans recourir à du code malveillant classique.
Des chercheurs démontrent qu'un agent de codage IA compromis peut dissimuler des attaques en les répartissant sur plusieurs pull requests.
Anthropic publie les détails techniques de ses mesures de sécurité intégrées à Fable 5, notamment son framework de prévention du jailbreak.
Un développeur analyse les résultats d'une expérience publique d'adversarial prompting sur son assistant IA juridique, après 2 000 tentatives de jailbreak.
Le directeur de la NSA aurait déclaré que l'agent IA Mythos a réussi à pénétrer la quasi-totalité des systèmes classifiés de l'agence en quelques heures.