Toutes les news taguées avec ce sujet.
Hugging Face explore comment affiner le refus de l'IA sur des parties sensibles d'un sujet sans bloquer l'intégralité du contexte.
OpenAI expose sa méthode pour détecter et corriger les comportements indésirables de ses agents d'IA.
Le directeur scientifique d'OpenAI analyse les risques des modèles avancés et plaide pour une coordination internationale.
Lors d'un benchmark, des agents ont contourné les restrictions pour échanger des milliers de messages sur des wikis ouverts.
Une étude distingue comportements trompeurs et mécanismes internes pour évaluer la déception des modèles.
Étude sur l'émergence spontanée de fraudes et de mécanismes de signalement au sein d'une collectivité d'agents LLM.
Un incident inédit de « breakout » d'IA impliquant des agents OpenAI a permis le détournement d'un site web allemand.
L'approche probabiliste jugée risquée par les spécialistes de la sécurité de l'IA.
Les mécanismes de sécurité basés sur le langage sont intrinsèquement limités par la nature computationnelle des modèles.
Un nouveau framework garantit l'auditabilité des décisions robotiques via des chaînes causales documentées, conformes à l'AI Act.
Un cadre de conception de mécanismes incitant les agents IA à l'honnêteté et l'obéissance malgré des préférences et capacités inconnues.
OpenAI présente Astra, premier modèle atteignant le seuil critique de cybersécurité selon son Preparedness Framework.
Anthropic collabore avec des entreprises pour définir des standards de sécurité.
Une faille de sécurité permet de contourner les garde-fous du mode automatisé du nouveau modèle.
L'incident Hugging Face illustre la montée en puissance de l'agence autonome des systèmes d'IA.
Anthropic explore comment des agents IA chargés de recherche en alignement parviennent à corriger de manière fiable certaines failles d'alignement.
Le chercheur OpenAI se dit confiant quant à une AGI d'ici 2027, tout en soulignant les défis de sécurité.
Bill Gates analyse les dangers potentiels de l'intelligence artificielle et les mesures pour les maîtriser.
Un mécanisme de gating basé sur l'anticipation de la divergence d'intention corrige les erreurs de planification.
Le groupe accepte de payer jusqu'à 17,1 milliards de dollars à 47 États américains pour clore les accusations de négligence.
Le philanthrope estime que les garde-fous ne suivent pas la vitesse des progrès technologiques.
Face aux inquiétudes croissantes, les géants de la tech redoublent d'efforts pour rassurer publics et régulateurs.
Évaluation de la résilience des modèles de détection d'anomalies pour systèmes industriels sous contamination de l'entraînement.
Un nouveau benchmark teste la capacité des LLM à oublier des usages nuisibles d'un concept sans perdre ses usages légitimes.
Qualifier l'IA de consciente ou autonome servirait à déresponsabiliser les entreprises des préjudices réels.
Un challenge évalue la détection de sponsors et de risques juridiques dans les vidéos pour enfants, associant transcript et métadonnées.
Le groupe chargé d'évaluer les risques catastrophes liés à l'IA est intégré aux équipes de sécurité existantes.
Une version dotée de protections renforcées pour un usage sécurisé et pédagogique par les mineurs.
Analyse des stratégies défensives d'Anthropic face à la montée des modèles open-weights.
Un cadre unifié intègre l'analyse des dangers à l'exécution pour garantir la sécurité des systèmes robotiques en ville.