SABRE : un pipeline automatisé pour construire des benchmarks de stress-test pour VLMs
Les modèles vision-langage s'améliorent vite, mais leurs benchmarks stagnent : SABRE automatise la création de tests difficiles et révèle des lacunes majeures.
arXiv cs.AI · cs.LG · cs.CL·Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou·7 août 2026

Image · Source originale
SABRE est un pipeline automatisé qui transforme une spécification de tâche en images générées ou éditées et en paires question-réponse, filtrées par un VLM puis validées par un humain. Testé via SABRE-Prior pour vérifier si les VLMs suivent les preuves visuelles plutôt que leurs a priori sur le monde, il montre une précision moyenne de seulement 22,6% sur six modèles. Des pilotes SABRE-Counting et SABRE-Spatial confirment que le workflow s'adapte à d'autres types de stress-tests.