Affiner sans recherche : distillation on-policy d'une distribution de puissance au niveau des séquences
Une nouvelle méthode d'entraînement permet à un modèle de produire en une seule génération des réponses aussi précises qu'avec un échantillonnage coûteux à 64 candidats.
arXiv cs.AI · cs.LG · cs.CL·Erfan Baghaei Potraghloo, Seyedarmin Azizi, Arya Fayyazi, Saeid Shokoufa·5 octobre 2026

Image · Source originale
Les auteurs proposent l'OPPD, une technique de distillation on-policy où un modèle en cours d'entraînement génère des candidats pondérés par la distribution de puissance d'un modèle enseignant figé. Cette méthode améliore la précision en une seule génération de jusqu'à 23 points sur MATH500 et 27,3 sur GSM8K, dépassant l'échantillonnage de puissance publié à 64 candidats. Comparée à GRPO sur un même budget, OPPD obtient de meilleurs scores sans réponses de référence vérifiées, et les deux approches se révèlent complémentaires.