AVA-Encoder : vers une représentation vidéo native pour les agents IA
Un nouveau framework transforme les vidéos en graphes de connaissances exploitables par des agents créatifs pour un raisonnement et un montage cinématographique.
arXiv cs.AI · cs.LG · cs.CL·Chuyue Li, Jinpeng Yu, Haozhe Wang, Tian Xueyun·12 août 2026

Image · Source originale
AVA-Encoder convertit une vidéo en graphe de connaissances structuré, combinant texte hiérarchique et couche d'assets (images, audio, vidéo), avant de la reconstruire. Un système d'optimisation par gradient textuel affine la politique d'encodage, en entraînement comme en test. Les auteurs rapportent un gain de 20,7 points face à la meilleure référence externe, avec une politique surpassant un réglage humain tout en réduisant de 74,3% les tokens de prompt système.