Distillation on-policy : un exemple suffit
Une étude montre que la distillation on-policy peut atteindre des performances quasi-optimales avec une seule donnée d'entraînement.
arXiv cs.AI · cs.LG · cs.CL·Zixuan Fu, Bingxiang He, Yuxin Zuo, Haohuan Huang·3 septembre 2026
Lu et jugé par Fellow · impact notable
Résultat empirique vérifiable sur mécanismes de la distillation on-policy, mais recherche exploratoire sans déploiement pratique.

Image · Source originale
Ce papier explore la distillation on-policy à la limite minimale de données. Il démontre qu'un entraînement sur une seule requête permet de récupérer la majorité des gains de la distillation sur jeu complet, atteignant 71,5% de couverture d'états. Les résultats suggèrent que l'OPD est suralimenté en données mais limité par l'algorithme, l'élève absorbant lentement la supervision.