Toutes les news taguées avec ce sujet.
Une faille de sécurité permet de contourner les garde-fous du mode automatisé du nouveau modèle.
Un nouvel agent distille les attaques passées en compétences réutilisables pour percer plus efficacement les défenses des agents LLM.
Des chercheurs exposent comment des LLM pourraient prendre le contrôle de leur machine hôte via une vulnérabilité des moteurs d'inférence.
Une étude révèle que l'alignement sécurité des modèles à diffusion est fragile, transférable, et exploitable via un jailbreak entièrement offline.