Code-switching multimodal : aligner objets visuels et texte de manière explicite
Une nouvelle méthode de pré-entraînement pour MLLM remplace les entités textuelles par des objets visuels, améliorant l'efficacité des données de façon marquée.
arXiv cs.AI · cs.LG · cs.CL·Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang·11 août 2026

Image · Source originale
Les MLLM actuels alignent images et texte au niveau global, ce qui crée une ambiguïté référentielle entre objets visuels et entités textuelles. MMCS interleave vision et langage en substituant les entités textuelles par leurs objets visuels correspondants, forçant un ancrage local. Avec seulement 50K échantillons, cette méthode égale ou dépasse des modèles entraînés sur 600K paires image-texte, tout en améliorant le grounding visuel.