Toutes les news taguées avec ce sujet.
Un pipeline transforme des logiciels de bureau réels en environnements hybrides pour entraîner des agents combinant interface graphique et ligne de commande.
Un framework transforme les historiques d'exécution d'agents en environnements reproductibles pour générer des tâches synthétiques et améliorer le post-training.
Une entreprise unifie 200+ applications internes sur un seul LLM en fusionnant des experts GRPO entraînés séparément via SLERP en deux étapes.
Une méthode transposable détermine la répartition idéale des données SFT et RL sans recherche exhaustive.
Une perspective industrielle sur l'ingénierie des données de post-training, entre budgets contraints et gains mesurables sur des benchmarks de code.
Le cadre IAR permet aux LLM d'intégrer des connaissances documentaires sans RAG, via une méthode en trois étapes.
Le CEO de Z.ai explique pourquoi le nombre de paramètres ne suffit plus et présente GLM 5.3.
Un nouveau runtime accélère le RL post-training des VLM en chevauchant traitement de préfixe et décodage de rollout sur GPU.
Une nouvelle politique d'admission au niveau routage optimise le partage du cache KV entre RLVR, RLHF et rollouts agentiques lors du post-training des LLM.
Nathan Lambert publie un ouvrage de référence sur le post-training, couvrant RLHF, rejet sampling et reward models.
Une méthode structurée pour dépasser les limites du SLU traditionnel, appliquée aux LLM et aux modèles audio-langage de grande taille.
Une nouvelle méthode de post-entraînement corrige le déséquilibre texte-image dans les modèles multimodaux pour améliorer le raisonnement visuel.