Video-DeepResearch : vers une nouvelle génération d'agents multimodaux de recherche approfondie
Un agent open-source combine analyse vidéo image par image et exploration web, dépassant Claude 4.5 Sonnet et GPT-5 sur un benchmark VQA complexe.
arXiv cs.AI · cs.LG · cs.CL·Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao·4 août 2026

Image · Source originale
Video-DR étend les agents multimodaux des images statiques aux flux vidéo continus, en corrigeant deux biais courants : le contournement des outils visuels au profit du texte, et la fuite de connaissances paramétriques. L'entraînement combine fine-tuning supervisé et GRPO pour forcer un ancrage visuel exhaustif avant la recherche web. Sur le nouveau benchmark Video-DR-Bench (200 instances multi-hop), le modèle 35B-A3B atteint 64,0% de précision, devançant Claude-4.5-Sonnet, GPT-5 et Gemini 2.5 Pro.