Toutes les news taguées avec ce sujet.
Un nouveau benchmark évalue la capacité des MLLM à parser et comprendre des diagrammes scientifiques complexes.
Une nouvelle méthode de pré-entraînement pour MLLM remplace les entités textuelles par des objets visuels, améliorant l'efficacité des données de façon marquée.
Un framework permet aux agents GUI de s'améliorer après déploiement sur des interfaces inconnues, sans annotation humaine, via un cycle exploration-réflexion-internalisation.
Une nouvelle méthode de post-entraînement corrige le déséquilibre texte-image dans les modèles multimodaux pour améliorer le raisonnement visuel.