Voir avant de synthétiser : détection d'événements de transition guidée par VLM pour le captioning vidéo dense faiblement supervisé
Un nouveau framework utilise un VLM pour générer des transitions vidéo ancrées visuellement, améliorant le captioning et la localisation d'événements.
arXiv cs.AI · cs.LG · cs.CL·Ye-Chan Kim, Seunghee Choi, SeungJu Cha, Si-Woo Kim·3 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration incrémentale d'une méthode de captioning vidéo, acceptée à EMNLP mais sans portée au-delà d'un benchmark de niche.

Image · Source originale
SBS propose une méthode qui exploite un VLM pour générer des narrations frame par frame entre événements et détecter les transitions via variation sémantique, plutôt que d'assigner des légendes de transition de façon rigide via LLM. Les masques temporels sont ensuite affinés en combinant point médian temporel et point de changement sémantique. La méthode atteint l'état de l'art sur ActivityNet Captions et YouCook2.