Diagram-MMU : benchmark multimodal pour diagrammes scientifiques
Un nouveau benchmark évalue la capacité des MLLM à parser et comprendre des diagrammes scientifiques complexes.
arXiv cs.AI · cs.LG · cs.CL·Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu·12 août 2026

Image · Source originale
Diagram-MMU est un benchmark introduit pour évaluer les compétences des Multimodal Large Language Models (MLLM) sur des diagrammes scientifiques. Composé de 3,7k diagrammes et 18,3k questions, il teste le parsing, l'édition et le question-answering. Les résultats indiquent que le diagram-to-code est plus difficile que le raisonnement visuel, bien que les configurations agentic améliorent globalement les performances.