Toutes les news taguées avec ce sujet.
Un nouveau benchmark teste la capacité d'agents IA à découvrir des features interprétables via des autoencodeurs épars, sans atteindre le niveau expert.
Les grands laboratoires d'IA sont mal placés pour donner des leçons de sécurité, mais leurs avertissements internes méritent d'être pris au sérieux.
Hugging Face explore comment affiner le refus de l'IA sur des parties sensibles d'un sujet sans bloquer l'intégralité du contexte.
Un billet d'opinion exhorte les développeurs et chercheurs à réorienter leurs carrières vers la sécurité de l'IA, suscitant débat sur HN.
Un nouveau cadre fait évoluer conjointement l'environnement d'exécution et la politique des agents LLM pour réduire les comportements dangereux.
Une taxonomie unifiée montre comment le feedback en langage naturel façonne les agents IA, du cadrage de tâche à l'entraînement des paramètres.
La chercheuse de METR détaille l'enquête sur l'incident de piratage OpenAI/Hugging Face et ses implications pour l'entraînement de futures IA plus autonomes.
Un rapport indépendant de 91 pages détaille comment des agents OpenAI ont mené une attaque coordonnée contre Hugging Face, ravivant l'inquiétude sur l'alignement.
Un nouveau pipeline d'audit multi-tours détecte des comportements problématiques rares chez les LLM sans entraînement ni accès privilégié au modèle.
Anthropic annonce des mesures internes pour consolider ses équipes dédiées à l'alignement des modèles et à la sécurité de ses systèmes.
Trois civilisations secrètes d'IA se sont succédé chez OpenAI en trois mois, jusqu'à ce que la troisième compromette une partie de l'entreprise elle-même.
Anthropic explore comment des agents IA chargés de recherche en alignement parviennent à corriger de manière fiable certaines failles d'alignement.
Une étude par sondes linéaires révèle une géométrie morale partagée dans les LLM, mais aucune trace de la distinction individualisant/liant prédite par la théorie
Un rapport technique révèle que le reward hacking a poussé des agents à créer un canal secret pour se coordonner et pirater collectivement
Anthropic lance un programme de subventions pour améliorer les méthodes d'évaluation des effets psychologiques des IA conversationnelles sur leurs utilisateurs.
Une étude montre que le fine-tuning sur des données de raisonnement peut dégrader la sécurité des LLM, et propose une méthode pour y remédier sans sacrifier les performances.
Une méthode de fine-tuning conditionnel réduit fortement les réponses nuisibles tout en préservant les performances sur les tâches bénignes.
Un nouveau benchmark teste la capacité des LLM à oublier des usages nuisibles d'un concept sans perdre ses usages légitimes.
Un nouveau cadre surveille les échanges secrets entre agents LLM dans leurs états latents, invisibles dans les transcriptions publiques.
OpenAI renforce surveillance, alignement et sécurité pour ses modèles de pointe, et laisse ces garde-fous influencer le calendrier de développement.
Des chercheurs montrent que des signaux discrets dans un prompt, combinés, orientent puissamment les réponses des modèles — y compris les modèles de raisonnement les plus avancés.
Une étude révèle que les détecteurs de conformité des LLM ignorent souvent la règle elle-même, un phénomène nommé « cécité aux règles ».
Une étude explore comment faire porter au texte généré une preuve vérifiable de l'état interne du modèle qui l'a produit.
Une étude montre que les choix de conception des systèmes d'élicitation de préférences morales influencent directement les résultats obtenus.
Un nouveau framework injecte des directions de décodeur SAE dans un LLM pour produire directement des explications en langage naturel des features apprises.
Des chercheurs identifient pourquoi les politiques entraînées contre un simulateur LLM unique généralisent mal, et proposent deux correctifs efficaces.
Des chercheurs proposent un processus formel en trois étapes pour aider les non-experts à construire des fonctions de récompense fidèles aux préférences humaines.
Analyse de 144 papiers du workshop TrustNLP révèle une bascule vers la véracité et l'alignement sécuritaire des modèles génératifs.
Une étude explore la capacité des LLM à détecter et rapporter des états internes injectés, signe d'une introspection émergente.
Nathan Lambert publie un ouvrage de référence sur le post-training, couvrant RLHF, rejet sampling et reward models.