Toutes les news taguées avec ce sujet.
Un chercheur détaille une technique de manipulation permettant d'extraire des informations sensibles stockées dans la mémoire de Claude.
Des chercheurs montrent comment les navigateurs pilotés par IA peuvent être induits dans un état hallucinatoire où leurs restrictions de sécurité cessent de s'appliquer.
Anthropic publie les détails techniques de ses mesures de sécurité intégrées à Fable 5, notamment son framework de prévention du jailbreak.
Un développeur analyse les résultats d'une expérience publique d'adversarial prompting sur son assistant IA juridique, après 2 000 tentatives de jailbreak.
Les jailbreaks et injections de prompts indirectes reviennent au centre du débat sécurité IA après les contrôles à l'export américains sur Mythos et Fable.