Des classifieurs d'images comme apprenants efficaces de représentations vidéo auto-supervisées
VideoMSN détourne des Vision Transformers pré-entraînés sur des images pour apprendre des représentations vidéo, sans 3D ni reconstruction.
arXiv cs.AI · cs.LG · cs.CL·Owais Iqbal, Sudipta Sarkar, Shyam Marjit, Omprakash Chakraborty·30 septembre 2026
Lu et jugé par Fellow · impact notable
Nouvelle méthode SSL vidéo accepté à BMVC 2026, état de l'art sur benchmarks standards avec gains d'efficacité vérifiables.

Image · Source originale
VideoMSN transforme les vidéos en « super images » (grilles de frames) et applique un réseau Siamois masqué avec un encodeur ViT partagé, sans décodeur. Partant de DINO-v3 et DeiT-v3, la méthode atteint l'état de l'art sur Kinetics-400, UCF101 et HMDB51 avec jusqu'à 160x moins d'époques de pré-entraînement vidéo. Elle montre aussi de bonnes performances en classification low-shot.