Toutes les news taguées avec ce sujet.
Le classement officiel du benchmark ARC-AGI est désormais accessible pour mesurer le raisonnement.
Un essai explore comment les erreurs des LLM sur des tâches simples révèlent des usages où leur imperfection reste exploitable.
Le laboratoire chinois Moonshot AI publie une nouvelle version de son modèle Kimi orientée raisonnement long, disponible en poids ouverts.
Un framework où un petit modèle décide lui-même quand solliciter un LLM, réduisant fortement les coûts d'inférence sans sacrifier la précision.
Une étude explore si les LLM peuvent extraire des stratégies réutilisables de leurs propres traces de résolution, comme le font les humains avec l'expérience.
Un nouveau cadre neuro-symbolique fusionne perception et déduction logique en un seul modèle entièrement différentiable, testé sur des tâches de VQA guidées par graphe de connaissances.
Deux nouveaux adaptateurs inspirés de Mamba ajoutent une mémoire dynamique au LoRA, avec des gains mesurables sur le raisonnement multi-sauts.
Une étude identifie un défaut fréquent des LLM en contexte long : recopier le texte source au lieu de raisonner, et propose une méthode de RL pour y remédier.
Des préfixes continus appris peuvent faire basculer les réponses correctes de plusieurs LLM sur des tâches de raisonnement syllogistique, révélant des failles de stabilité logique.
Le laboratoire français détaille une architecture combinant raisonnement rapide et lent, inspirée des travaux en psychologie cognitive.
Un billet compare deux modèles sur un problème d'optimisation NP-difficile pour évaluer l'apport d'une fonctionnalité de guidage par objectif.
Un tour d'horizon des « world models », leur potentiel pour l'IA générative et physique, et les obstacles techniques qui subsistent.
Un nouveau cadre, E3, apprend aux agents LLM à estimer l'effort nécessaire avant d'agir, réduisant drastiquement coûts et sur-lecture inutile de code.
Un nouveau benchmark évalue la capacité des LLM à produire et vérifier des preuves de niveau universitaire à doctoral, au-delà des olympiades.
Un essai revient sur les capacités surprenantes des grands modèles de langage à résoudre des problèmes mathématiques avancés.
Un mécanisme d'enchères pour router chaque étape de raisonnement vers le modèle expert le plus compétent, pas le plus confiant.
Le laboratoire français présente une architecture combinant réflexes rapides et raisonnement approfondi pour ses agents autonomes.
Le physicien Adam Brown distille l'essence de la relativité générale et évoque la capacité des IA à redécouvrir cette théorie par elles-mêmes.
Un développeur indépendant publie Lucid, un outil qui expose et rend éditables les étapes de réflexion d'un modèle d'IA avant qu'il génère sa réponse.
Un framework open-source qui transforme la génération vidéo en mécanisme de raisonnement séquentiel, alternatif au Chain-of-Thought textuel.
Une méthode de feedback adaptatif ajuste dynamiquement la longueur du préfixe de solution fourni au modèle, doublant la précision de GRPO sur les problèmes mathématiques difficiles.
Deux modèles s'affrontent et se notent mutuellement pour améliorer leur raisonnement, sans étiquettes de processus ni reward model externe.
Une méthode transfère le signal RLVR d'un petit modèle vers un plus grand, sans relancer le RL coûteux sur la cible.
Un essai de réflexion sur le compromis fondamental entre largeur (MoE, parallélisme) et profondeur (chaînes de raisonnement) dans l'architecture des modèles de langage.
Un essai technique explore comment des garanties globales sur un système peuvent émerger de raisonnements purement locaux sur ses composants.
Une approche neuro-symbolique combine des réseaux récurrents équivariants avec des solveurs SAT classiques pour accélérer la résolution de contraintes.
Un nouveau framework limite les fuites d'information et préserve la capacité d'exploration des LLMs lors de la distillation sur politique.
Des chercheurs remettent en question les capacités réelles des LLM actuels et débattent des prochaines directions pour l'intelligence artificielle.
Une méthode d'inférence sans entraînement améliore l'utilisation des preuves dans les LLMs sur des contextes de 128K tokens.
Un pipeline convertit un re-ranker autorégressif avec chaîne de pensée en modèle de diffusion par blocs, sans sacrifier la précision du classement.