RECHERCHE
β-OPSD : optimisation par politique et auto-distillation
Une nouvelle méthode généralise l'auto-distillation on-policy en introduisant un paramètre β pour équilibrer stabilité et performance.
arXiv cs.AI · cs.LG · cs.CL·Jiawei Xu, Minghui Liu, Juzheng Zhang, Tom Goldstein·30 juillet 2026

Image · Source originale
Les chercheurs présentent β-OPSD, une généralisation de l'auto-distillation on-policy (OPSD) qui intègre une pénalité KL ajustable via un paramètre β. En transformant l'objectif d'optimisation de politique en cible de distillation, cette approche réduit la variance et les coûts computationnels. Les résultats sur des benchmarks de raisonnement mathématique montrent des performances supérieures à l'OPSD standard.