FastBench : les VLM en streaming perçoivent-ils les flux réels à haute dynamique ?
Un nouveau benchmark de 306 questions révèle les limites des VLM en streaming face aux événements rapides : le meilleur modèle, Gemini-3.5-Flash, n'atteint que 50,7 %.
arXiv cs.AI · cs.LG · cs.CL·Yuxuan Hu, Weikang Shi, Yang Bo, Xudong Lu·8 octobre 2026
Lu et jugé par Fellow · impact léger
Benchmark de 306 questions avec pipeline vérifié et code/données publiés, plus une baseline sans entraînement ; utile pour la recherche en VLM streaming, portée limitée et sans citation externe.

Image · Source originale
FastBench évalue la perception haute dynamique des VLM en streaming, à partir de 306 paires QA couvrant huit domaines et six capacités, vérifiées par trajectoires (SAM3, CoTracker3) et inspection humaine. Gemini-3.5-Flash plafonne à 50,7 %. Qwen3-VL-8B passe de 32,9 % à 2 FPS à 44,6 % à 24 FPS. La baseline ProactiveFrame, sans entraînement, gagne 5,4 et 1,5 points sur l'échantillonnage uniforme épars, mais reste loin de l'oracle.
#benchmark#VLM#streaming-video#perception-temporelle#ProactiveFrame