Des gradients aux capacités : comprendre la distillation multi-enseignants on-policy
Une étude disséquant comment les signaux de plusieurs enseignants RL façonnent réellement les paramètres d'un modèle étudiant.
arXiv cs.AI · cs.LG · cs.CL·Siqi Zhu, Suozhi Huang, Kaixuan Zhang, Yuheng Yang·1 octobre 2026

Image · Source originale
Les chercheurs étudient Qwen3-1.7B distillé à partir de quatre enseignants entraînés par RL, en analysant gradients, mises à jour Adam et précision BF16. Ils montrent que le moyennage des pertes introduit des biais de pondération implicites, qu'Adam lisse fortement les différences entre enseignants, et que l'arrondi BF16 masque la majorité des changements de poids réels. L'effet sur les performances dépend fortement de la méthode de moyennage choisie.