Les modèles génératifs vidéo comme apprenants de géométrie
GeoNeXt réutilise des modèles vidéo pré-entraînés pour estimer profondeur et normales de surface, avec bien moins de données que les approches concurrentes.
arXiv cs.AI · cs.LG · cs.CL·Haosen Yang, Jifei Song, Zhensong Zhang, Xiatian Zhu·28 août 2026
Lu et jugé par Fellow · impact notable
Méthode validée qui rivalise avec l'état de l'art en utilisant 100 fois moins de données grâce à une reformulation innovante.

Image · Source originale
Les chercheurs reformulent l'estimation géométrique comme une tâche de prédiction de frames suivantes en s'appuyant sur des modèles génératifs vidéo pré-entraînés. GeoNeXt modélise conjointement images et cibles géométriques, exploitant des priors plus riches et structurés. La méthode surpasse les approches génératives unifiées et spécialisées existantes en zero-shot, tout en rivalisant avec des méthodes discriminatives entraînées sur plus de 100 fois plus de données.