OPD-V : auto-distillation on-policy visuelle avec équilibrage des modalités
Une nouvelle méthode de post-entraînement corrige le déséquilibre texte-image dans les modèles multimodaux pour améliorer le raisonnement visuel.
arXiv cs.AI · cs.LG · cs.CL·Aniri, Jinhe Bi, Peng Liao, Zengjie Jin·5 août 2026

Image · Source originale
Les chercheurs identifient un problème de déséquilibre entre modalités dans l'auto-distillation on-policy des MLLM : le texte domine souvent au détriment de l'information visuelle. Ils proposent OPD-V, qui utilise un teacher positif (image zoomée) et un teacher négatif (image masquée) pour définir une région de confiance sélectionnant les tokens pertinents. Testée sur 6 benchmarks, 4 architectures et 5 méthodes de post-entraînement, l'approche améliore le raisonnement tout en réduisant le coût d'entraînement.