ParVL : scaling parallèle pour MLLMs
Une nouvelle stratégie d'allocation de calcul dynamique entre vision et langage pour optimiser les MLLMs.
arXiv cs.AI · cs.LG · cs.CL·Yang Yang, Qinyu Zhao, Mouxiang Chen, Xiaohui Li·4 août 2026

Image · Source originale
Le framework ParVL permet un scaling parallèle des Multimodal LLMs en réutilisant les paramètres des backbones ViT et LLM via des branches spécifiques. Cette approche optimise l'allocation des calculs entre modalités visuelle et linguistique, surpassant les modèles à branche unique après un entraînement sur 13B tokens.
#mlmm#scaling#vit#compute-allocation#arxiv