VioLA : apprendre des politiques de contrôle humanoïde généralistes à partir de données humaines
En prédisant des latents de mouvement plutôt que des commandes articulaires, VioLA exploite 140,6 M de frames dont 93,2 % humaines et suit des instructions de locomotion en zero-shot sur un robot réel.
arXiv cs.AI · cs.LG · cs.CL·Mert Albaba, Jens Beißwenger, Anna Manasyan, Daniel Marta·8 octobre 2026
Lu et jugé par Fellow · impact notable
Papier arXiv avec résultats chiffrés sur robot réel (100 % en locomotion zero-shot contre 16,7 % pour GR00T N1.7) ; code et checkpoints seulement annoncés, pas d'évaluation indépendante.

Image · Source originale
VioLA est une politique humanoïde généraliste qui prédit des latents de mouvement du corps et des mains, exécutés par des contrôleurs pré-entraînés. Des encodeurs alignent mouvements humains et robot dans les mêmes espaces latents, ce qui permet d'exploiter des enregistrements humains (93,2 % de 140,6 M de frames). Sur robot réel, VioLA atteint 100 % de succès en locomotion zero-shot, contre 16,7 % pour GR00T N1.7 et 0 % pour Ψ_0, et 88,6 % en manipulation sans fine-tuning spécifique.
#robotique#humanoïdes#VLA#zero-shot#données-humaines