Toutes les news taguées avec ce sujet.
Une méthode sépare la génération de tests de la réparation pour améliorer les performances des agents.
Une méthode de reinforcement learning test-time exploitant des probes exécutables pour améliorer les modèles de code.
Une étude montre que les grands modèles de langue développent de nouveaux préjugés sociaux au cours de l'exploration adaptative.
Danijar Hafner mise sur les world models et le reinforcement learning pour permettre à des robots humanoïdes de s'adapter à des environnements inconnus.
Un nouveau cadre PAC pour les jeux stochastiques concurrents garantit un équilibre de Nash ou certifie son inexistence.
Une architecture hybride couple un encodeur de graphe et un agent PPO pour fiabiliser les LLM analystes en cybersécurité à grande échelle.
Hugging Face détaille une expérience de reinforcement learning appliquant un modèle de génération de code à une tâche créative inhabituelle.
Un nouveau cadre fait évoluer conjointement l'environnement d'exécution et la politique des agents LLM pour réduire les comportements dangereux.
Nemotron-3-Ultra-CC dépasse le meilleur score humain à l'IOI 2026, une première pour un système d'IA sur ce type d'épreuve.
SAGE interroge un VLM seulement en cas d'incertitude pour distiller une politique RL légère, autonome à l'évaluation.
Un nouveau modèle robotique prédit les forces de contact générées par ses actions pour atteindre une précision sub-millimétrique en assemblage.
Une taxonomie unifiée montre comment le feedback en langage naturel façonne les agents IA, du cadrage de tâche à l'entraînement des paramètres.
Un nouveau benchmark teste si les agents peuvent apprendre de leurs propres erreurs.
Un nouveau framework transforme les papiers scientifiques en environnements d'entraînement RL pour évaluer la planification de recherche des IA, sans fuite de critères.
Un nouveau système, Kuafu, synthétise automatiquement des programmes sémantiques pour entraîner des politiques robotiques sans démonstrations ni récompenses manuelles.
Un framework de deep reinforcement learning en boîte noire surpasse l'état de l'art pour évader les détecteurs Android, et pour les rendre plus robustes.
Une main anthropomorphe à câbles optimisée pour l'apprentissage par renforcement en simulation.
Comparaison de Merge, Mix RL et MOPD pour fusionner des modèles experts sans perte de capacités.
Une méthode perturbe les trajectoires via des modèles plus faibles pour préserver la diversité et la couverture du raisonnement.
Une méthode d'apprentissage sans étiquettes qui combine distillation et RL pour améliorer le raisonnement mathématique.
Une méthode de post-training transforme des VLMs standards en raisonneurs robotiques capables de guider des politiques de manipulation complexes.
Une technique qui tronque la mémoire des LLM pendant le raisonnement long, sans perte de performance, pour un scaling moins coûteux.
Un benchmark proposant 300 tâches procédurales et des récompenses vérifiables pour entraîner le raisonnement visuel par génération.
Un framework génère des trajectoires d'interaction via des navigateurs parallèles pour entraîner des agents visuels.
Une méthode de post-traitement isotone corrige les biais des estimateurs de ratio d'occupation sans nécessiter de réoptimisation complète du modèle.
Deux contributions techniques — POLAR et un encodeur PLE — pour renforcer les modèles unifiés résolvant plusieurs variantes du VRP.
Une méthode améliorant l'efficacité de l'apprentissage en ligne pour les agents IA utilisant des outils de manière asynchrone.
BPCO stabilise l'entraînement des critics en RL, offrant une alternative fiable aux méthodes group-based comme GRPO.
Une méthode RL exploitant le retrieval multimodal pour réduire les hallucinations et améliorer les légendes d'images.
Une nouvelle méthode d'entraînement d'agents module l'usage des compétences action par action, au lieu d'un choix uniforme pour toute une trajectoire.