Long-WAM : étendre le contexte des modèles monde-action pour le contrôle robotique en temps réel
Un framework qui démontre que la pré-entraînement autorégressif permet d'exploiter efficacement de longues historiques visuelles pour la manipulation robotique, avec des gains de 15 points de succès sur RoboCasa GR-1.
arXiv cs.AI · cs.LG · cs.CL·Wei Huang, Bohan Zhang, Chenzhi Liu, Isabella Liu·7 octobre 2026
Lu et jugé par Fellow · impact notable
Article de recherche arXiv avec résultats chiffrés vérifiables (+15,4 pts de succès sur RoboCasa GR-1, 95% sur stacking dynamique vs 0% pour Pi0.5/Fast-WAM) et déploiement temps réel documenté, mais sans code ni poids publiés — avancée incrémentale sur les world-action models, pas de rupture de para

Image · Source originale
Long-WAM est un framework système pour les modèles monde-action causaux qui résout le compromis entre contexte long et latence en temps réel. L'étude montre que l'accès à l'historique ne suffit pas : c'est la pré-entraînement autorégressif (AR) qui permet d'en tirer profit, contrairement à une initialisation bidirectionnelle. Sur RoboCasa GR-1, passer de 0 à 19,2 secondes de contexte fait passer le taux de succès de 63,3 % à 78,7 %. Le système atteint les meilleurs résultats sur LIBERO-Long, RoboTwin 2.0 et DOMINO, et se déploie sur RTX 5090, DGX Spark et Jetson AGX Thor avec une latence de 107,4 ms par chunk d'action. Sur Unitree G1 et YAM, il atteint 95 % de succès sur le stacking dynamique de tasses, là où Pi0.5 et Fast-WAM échouent systématiquement.
#robotique#world-models#vision-par-ordinateur#manipulation#temps-réel#pré-entraînement-autorégressif