Toutes les news taguées avec ce sujet.
Une étude montre que l'imitation naïve d'un expert dégrade les performances des petits modèles agentiques, contrairement à une correction ciblée sur leurs propres trajectoires.
Un nouveau benchmark et une méthode de synthèse par exécution permettent à un modèle open-source de 9B de rivaliser avec un 27B non affiné.
Une méthode de compilation qui transforme une description textuelle en petit modèle spécialisé, autonome et réutilisable, sans dépendre d'un LLM distant.
Hugging Face montre comment améliorer les sorties structurées d'un petit modèle via GRPO avec TRL, en seulement 100 étapes d'entraînement.
Nemotron-3-Ultra-CC dépasse le meilleur score humain à l'IOI 2026, une première pour un système d'IA sur ce type d'épreuve.
Une étude montre que le feedback utilisateur améliore réellement les révisions de modèles, mais que les juges LLM échouent à le reconnaître.
Cette méthode génère des simulateurs individualisés capables de mimétisme comportemental et de réactivité aux corrections pédagogiques.
Analyse mécaniste de l'évaluation automatique par LLM pour identifier les couches responsables de la notation.
Une perspective industrielle sur l'ingénierie des données de post-training, entre budgets contraints et gains mesurables sur des benchmarks de code.
Une nouvelle méthode corrige le biais de représentation lors du merging de LLMs en pondérant l'erreur par l'entropie.
CAST utilise des autoencodeurs épars pour détecter et supprimer les artefacts de notes médicales, rendant les prédictions de mortalité plus robustes et traçables.
Une nouvelle borne mathématique définit l'erreur minimale atteignable par le fine-tuning LoRA en fonction du rang.
Des chercheurs adaptent Whisper à une langue arawak parlée au Brésil, en Colombie et au Venezuela, avec seulement 0,54 heure d'audio annoté.
Hugging Face détaille comment entraîner et fine-tuner des modèles d'embeddings multi-vecteurs via la bibliothèque Sentence Transformers.
Une étude montre que le fine-tuning sur des données de raisonnement peut dégrader la sécurité des LLM, et propose une méthode pour y remédier sans sacrifier les performances.
Une méthode de fine-tuning conditionnel réduit fortement les réponses nuisibles tout en préservant les performances sur les tâches bénignes.
Une nouvelle méthode d'entraînement d'agents module l'usage des compétences action par action, au lieu d'un choix uniforme pour toute une trajectoire.
Expériences concluantes d'entraînement de Qwen 3 4B sur un domaine spécifique.
Deux approches de fine-tuning (contrastif et triplet) ont permis de remporter le challenge AES AIMLA 2025 sur la recherche sonore par imitation vocale.
Une méthode de distillation corrige le désaccord entre teacher et vérificateur pour améliorer le raisonnement sur des contextes longs.
Ornith-1.5 explore une méthode de self-improvement itérative basée sur du self-scaffolding pour booster les performances des LLM.
L'étude explore l'usage de petits modèles de langage internes pour classifier les factures financières avec précision.
Le sMuon étend l'optimiseur Muon au fine-tuning efficace pour améliorer les performances LoRA.
Une étude analyse les compromis entre mode « réflexion » et mode concis lors de l'entraînement conjoint de LLM sur des problèmes mathématiques.
Un système autonome ajuste des tâches d'agents terminaux selon leur difficulté réelle pour un solveur donné, améliorant nettement les performances d'entraînement.
Un nouveau framework transforme les récompenses binaires éparses en supervision dense étape par étape pour mieux entraîner les agents de recherche multi-étapes.
PleIAs publie Finance Commons, un vaste corpus ouvert pour le LLM fine-tuning.
Adaptation complète de la stack Nemotron pour le RAG en grec moderne, avec création du benchmark HERA.
Une collection de 50 générateurs pour l'entraînement supervisé par complétion, améliorant les performances sur DROP et ARC-Challenge.