RECHERCHE
MIRROR : optimiser le raisonnement multi-modal par vues croisées
Une méthode RL exploitant les vues texte et image pour améliorer la cohérence des modèles de vision-language.
arXiv cs.AI · cs.LG · cs.CL·Wen Ye, Yuxiao Qu, Aviral Kumar, Xuezhe Ma·23 juillet 2026

Image · Source originale
Les Vision-Language Models (VLMs) montrent des incohérences selon qu'ils résolvent des problèmes via le texte ou le diagramme. Les auteurs proposent MIRROR, une approche par renforcement qui utilise la meilleure vue comme professeur pour entraîner les autres, améliorant ainsi la précision et la constance sur des benchmarks géométriques.