EgoLAP : apprendre à partir de données humaines égocentriques via un raisonnement langage-action
Un nouveau framework VLA transforme les trajectoires humaines en langage d'action structuré pour mieux transférer les compétences aux robots.
arXiv cs.AI · cs.LG · cs.CL·Lihan Zha, Shresth Grover, Tenny Yin, Samuel M. Bateman·6 octobre 2026
Lu et jugé par Fellow · impact léger
Papier de recherche avec résultats expérimentaux chiffrés mais non répliqué indépendamment, portée limitée au transfert humain-robot.

Image · Source originale
EgoLAP est un framework de pré-entraînement vision-langage-action qui exploite conjointement des données humaines et robotiques via une chaîne de raisonnement en langage naturel. L'intention de mouvement est exprimée sous forme d'actions langagières abstraites, couplées à un raisonnement ancré dans la géométrie de scène et les affordances des objets. Les expériences montrent un gain de performance de 2,3x par rapport aux représentations d'action alternatives, avec 80,1% de progression moyenne sur des tâches réelles.
#robotique#vla#apprentissage-par-imitation#chain-of-thought#transfert-humain-robot