Toutes les news taguées avec ce sujet.
Les modèles multimodaux les plus avancés s'effondrent face à des tâches nécessitant une perception visuelle itérative, loin derrière les humains.
Une méthode d'exploration autonome d'environnements GUI permet à un modèle 7B de surpasser Qwen2.5-VL-32B sur la planification de tâches.
Un nouveau benchmark contrôlé révèle que les grands modèles multimodaux échouent massivement dès que la complexité spatiale 3D augmente.
Une étude révèle qu'aucun des 18 grands modèles multimodaux testés n'est invariant à l'ordre de présentation des données, avec des taux d'inversion atteignant 50 %.
Un framework de Chain-of-Thought visuel latent améliore le suivi des contraintes structurelles (comptage, relations spatiales, attributs) en génération texte-image.