VIALS : un benchmark pour l'interprétation visuelle d'artefacts en sciences de la vie
161 tâches d'interprétation d'images scientifiques révèlent les limites des modèles vision-langage face aux workflows réels de biotech.
arXiv cs.AI · cs.LG · cs.CL·Elaine Lau, Thanuka Udumulla, Lee Izhaki-Tavor, Francisco Guzmán·21 août 2026
Lu et jugé par Fellow · impact notable
Publication d'un benchmark avec 161 tâches vérifiant l'incapacité des modèles SOTA à interpréter des images scientifiques réelles.

Image · Source originale
VIALS est un benchmark de visual question-answering comportant 161 tâches d'interprétation d'artefacts scientifiques (gels, microscopie, cartes plasmidiques, cytométrie de flux, structures moléculaires) issus de workflows réels en biotech, et non de figures publiées. Les modèles vision-langage de pointe échouent à interpréter correctement ces images, contrairement aux experts du domaine pour qui la tâche reste simple. Les auteurs soulignent que cette limite freine l'utilité de l'IA dans les workflows professionnels des sciences de la vie.