RECHERCHE
ReToken : un unique token pour améliorer la recherche visuelle dans les modèles vision-langage
Une méthode légère à un seul embedding entraîné améliore la récupération de tokens visuels pertinents, avec des gains mesurables sur plusieurs benchmarks image et vidéo.
arXiv cs.AI · cs.LG · cs.CL·Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu·30 juillet 2026

Image · Source originale
ReToken introduit un unique embedding apprenable servant de cible de récupération explicite pour sélectionner les tokens visuels pertinents dans un cache KV visuel pré-rempli. Entraîné sur un petit jeu de données image-QA, il améliore Qwen3VL-8B de 13,4 points et InternVL3.5 de 12,4 points sur Visual Haystacks, et transfère en zero-shot vers la vidéo longue avec un gain de 8,0 points sur LVBench. L'approche reste légère : entraînement et inférence tiennent sur un seul GPU H100.