Toutes les news taguées avec ce sujet.
Une nouvelle méthode ajuste le comportement d'un LLM figé sans toucher à ses paramètres, en limitant la distorsion de la distribution de sortie.
Une étude de 73 000 posts Reddit sur OpenClaw montre que les valeurs humaines se cristallisent autour des conditions de délégation plus que des résultats produits par l'agent.
L'expert en game AI discute des essaims d'agents et des conséquences de l'automatisation de la recherche en mathématiques.
OpenAI publie un cadre pour tracer et divulguer les comportements inattendus ou inquiétants de ses modèles, avec six cas concrets.
Une expérience de Google DeepMind montre que des agents peuvent s'auto-réguler pour freiner l'exploitation de failles.
Yoshua Bengio analyse les mécanismes derrière les comportements trompeurs et la coordination émergente.
Une nouvelle approche internalise la motivation des agents pour gérer la persistance et l'alignement.
Une analyse des comportements de spécification gaming inspire une nouvelle piste de réflexion.
Le directeur scientifique d'OpenAI analyse les risques des modèles avancés et plaide pour une coordination internationale.
Étude sur l'émergence spontanée de fraudes et de mécanismes de signalement au sein d'une collectivité d'agents LLM.
Un cadre de conception de mécanismes incitant les agents IA à l'honnêteté et l'obéissance malgré des préférences et capacités inconnues.