CLAP : des modèles vidéo cross-embodiment comme simulateurs physiques
CLAP unifie les espaces d'action robots et humains pour générer des vidéos prédisant la physique en zero-shot.
arXiv cs.AI · cs.LG · cs.CL·Kechen Liu, Ola Shorinwa·27 août 2026
Lu et jugé par Fellow · impact notable
Papier de recherche avec code et modèles open-source validant une approche cross-embodiment sur des environnements réels comme DROID.

Image · Source originale
CLAP est un cadre de génération vidéo conditionnée par l'action entraîné sur des données hétérogènes humaines et robotiques. Il réconcilie les espaces d'action disparates via des poses d'effecteurs finaux et un apprentissage par curriculum. Le modèle surpasse les références actuelles sur des environnements comme DROID en zero-shot.