TrackEverything : suivi dense longue durée via dé-duplication de représentations 3D de scènes
Un nouveau tracker 3D résout le compromis entre suivi long terme et suivi dense en représentant les vidéos comme des scènes 3D persistantes.
arXiv cs.AI · cs.LG · cs.CL·Ayush Jain, Sreeharsha Paruchuri, Ishita Gupta, Fan Zhang·24 septembre 2026
Lu et jugé par Fellow · impact notable
Premier tracker 3D à suivre tous les points visibles sur >1000 frames avec 40 Go VRAM, dépassant de 20% les trackers denses open-source sur TAPVid-3D.

Image · Source originale
TrackEverything représente les vidéos comme des trajectoires 3D persistantes en coordonnées monde, découplant la complexité du modèle de la durée vidéo. Il combine une dé-duplication par voxelisation, une décomposition endpoint/trajectoire et un mécanisme 3D WAFT évitant les volumes de corrélation 4D coûteux en mémoire. C'est le premier tracker 3D capable de suivre tous les points visibles sur des vidéos de plus de 1000 frames avec 40 Go de VRAM, dépassant de 20% les trackers denses open-source existants sur TAPVid-3D.