RECHERCHE
Visual Contrastive Self-Distillation
Une méthode de self-distillation visuelle qui surpasse les OPSD existants sur Qwen-VL.
arXiv cs.AI · cs.LG · cs.CL·Yijun Liang, Yunjie Tian, Yijiang Li, Yuqi Jia·23 juillet 2026

Image · Source originale
Les chercheurs proposent Visual Contrastive Self-Distillation (VCSD), une méthode de self-distillation on-policy pour modèles vision-langage. VCSD génère un signal d'apprentissage contrastif en comparant les distributions de probabilité d'un enseignant EMA conditionné sur l'image originale et sur une image dont le contenu est effacé. Sur le dataset ViRL39K, VCSD améliore les performances des modèles Qwen2-VL et Qwen2.5-VL sans nécessiter d'enseignant externe ni d'information privilégiée.