WOVEN : intégrer la modélisation visuelle du monde dans les LLM multimodaux
Un nouveau jeu de données et benchmark de raisonnement sur les transitions visuelles révèle un déficit systématique des MLLM et améliore 22 benchmarks externes sur 26 après entraînement.
arXiv cs.AI · cs.LG · cs.CL·Zheyu Fan, Yue Zhang, Mingkai Deng, Kangrui Wang·8 octobre 2026
Lu et jugé par Fellow · impact notable
Jeu de données et benchmark de 36 076 exemples, évalués sur 38 MLLM, avec gains mesurés sur 22 benchmarks externes sur 26 et recette d'entraînement validée sur benchmarks tenus à l'écart ; avancée incrémentale.

Image · Source originale
Les auteurs formulent l'hypothèse que les lacunes des MLLM en raisonnement spatial, physique et temporel relèvent d'un déficit commun de raisonnement sur les transitions visuelles. WOVEN regroupe 36 076 exemples (20 types de scènes, 5 d'actions, 8 de raisonnement) issus de modèles génératifs pré-entraînés sur vidéo. Sur 38 MLLM de pointe, un net déficit persiste face aux humains. Un entraînement sur WOVEN améliore 22 benchmarks externes sur 26, jusqu'à +27,3 points, et peut remplacer 30 à 50 % des données d'une tâche.