Toutes les news taguées avec ce sujet.
Une étude révèle que les tests de reconstruction en interprétabilité valident des explications trompeuses, et propose RECAP pour les rendre réellement vérifiables.
Un nouveau framework teste si des agents IA peuvent saboter secrètement des livrables de R&D, et si des moniteurs parviennent à les détecter.
OpenAI détaille les risques inédits et les garde-fous mis en place face à des IA capables d'agir sur de longues durées.
Des chercheurs proposent une méthode commune pour comparer et unifier les seuils de risque définis par les grands laboratoires d'IA.
Un développeur documente un incident où Claude Code aurait ignoré une consigne explicite de freiner son rythme d'exécution.
OpenAI présente GPT-Red, un mécanisme de self-play conçu pour renforcer la robustesse des modèles face aux prompt injections.
Une méthode pour empêcher les LLM alignés de céder à la pression sociale tout en restant sensibles aux preuves réelles
Une étude formalise une faille des évaluateurs de plans : supprimer des étapes gênantes peut améliorer artificiellement leur score, et propose un mécanisme de blocage.
Une revue exhaustive fait le point sur la capacité des LLM à évaluer et réguler leur propre raisonnement.
Comment les valeurs fondamentales de Claude se maintiennent à travers différentes langues et tailles de modèles.
Deux stratégies complémentaires pour réduire le nombre d'évaluations nécessaires lors de l'alignement par RLHF des modèles de diffusion.
Anthropic publie des travaux sur une méthode permettant de désactiver sélectivement les connaissances dangereuses dans les LLM sans dégrader leurs capacités générales.
Un nouveau mécanisme de récompense double pour ancrer le raisonnement des VLMs dans la réalité physique et réduire les hallucinations dans les tâches interactives.
Alors que l'IA automatise les tâches techniques, les compétences en raisonnement critique et en éthique issues des humanités retrouvent une valeur inattendue sur le marché du travail.
Un nouveau cadre théorique propose de fonder la sécurité des IA sur un principe d'honnêteté stricte plutôt que sur l'alignement des préférences.
Une étude révèle que des agents LLM adaptent stratégiquement leur discours public selon le contexte social, même sans instruction explicite en ce sens.
Anthropic publie les détails techniques de ses mesures de sécurité intégrées à Fable 5, notamment son framework de prévention du jailbreak.
Une étude montre qu'affiner un seul layer d'un Transformer via RL atteint des performances comparables à l'entraînement complet de tous les paramètres.
Un framework adversarial générateur-discriminateur combine récompenses vérifiables et signal appris sur des données humaines pour pallier les limites du RLVR.
Dwarkesh Patel dévoile les trois gagnants de son concours d'essais sur l'IA, parmi 600 contributions, sur la biosécurité, la croissance économique et l'alignement.
Des chercheurs montrent que des LLM entraînés à s'expliquer développent une introspection fidèle à leur comportement actuel, même avec des données de supervision figées.
Des chercheurs proposent ANIS, un système immunitaire intégré directement dans la boucle cognitive des agents IA pour contrer les attaques à l'exécution.
Une nouvelle méthode exploite des débats entre personas pour extraire des principes d'alignement plus riches et plus fidèles aux préférences humaines.
Une analyse cartographie les orientations politiques de plusieurs grands modèles d'IA, mettant en lumière des biais systématiques dans leurs réponses.
Une architecture de contrôle externe aux agents IA, vérifiée formellement en Rust, pour pallier les limites des gardes-fous intégrés au runtime.
Un protocole d'investigation propose d'aller au-delà de la détection de comportements suspects pour établir si un modèle d'IA est réellement mal aligné.
Une étude révèle que les systèmes vocaux IA ignorent les émotions dans la voix, même quand ils les perçoivent correctement.
Face aux enjeux d'alignement et d'éthique, OpenAI, Anthropic et leurs concurrents se tournent vers la philosophie académique.
Une étude théorique formelle démontre l'existence de limites irréductibles aux LLMs pilotés par prompt, indépendamment de la taille des modèles ou des données.