H-JEPA : apprentissage de bout en bout de modèles du monde hiérarchiques pour la planification visuelle
Une architecture JEPA hiérarchique améliore fortement la planification long-terme, avec un gain spectaculaire sur Visual AntMaze (18% → 73%).
arXiv cs.AI · cs.LG · cs.CL·Wancong Zhang, Basile Terver, Michael Rabbat, Yann LeCun·5 octobre 2026
Lu et jugé par Fellow · impact notable
Gain vérifiable (18%→73%) sur benchmark simulé avec ablations, mais limité à 4 environnements et une seule source.

Image · Source originale
Des chercheurs de Meta FAIR, dont Yann LeCun, proposent H-JEPA, une hiérarchie de modèles JEPA conditionnés par l'action où chaque niveau prédit à un horizon temporel différent dans son propre espace latent. La planification se fait du haut vers le bas, chaque niveau générant des sous-objectifs pour le niveau inférieur. Sur quatre environnements simulés de navigation et manipulation, cette approche surpasse un JEPA plat, avec des gains également observés sur des vidéos réelles de robots (DROID).