Au-delà de la vraisemblance du teacher : distillation on-policy calibrée par groupe pour le raisonnement long-contexte
Une méthode de distillation corrige le désaccord entre teacher et vérificateur pour améliorer le raisonnement sur des contextes longs.
arXiv cs.AI · cs.LG · cs.CL·Zhu Zhang, Jixun Wang, Xiaoang Xu, Xiaorong Wang·19 août 2026
Lu et jugé par Fellow · impact léger
Amélioration incrémentale mesurée sur benchmarks propres, sans évaluation indépendante ni adoption au-delà des auteurs.

Image · Source originale
Les auteurs montrent que la distillation on-policy classique perd en fiabilité sur les tâches à long contexte car le teacher favorise des réponses localement plausibles mais incomplètes. Ils proposent GC-OPD, qui calibre les récompenses du vérificateur et les scores du teacher par groupe pour capturer leur désaccord, puis redistribue ce signal au niveau des tokens. Sur cinq benchmarks long-contexte, la méthode améliore significativement les performances de Qwen3-4B et Qwen3-8B par rapport à l'OPD classique.