Dynin-Robotics : un modèle Vision-Language-Action par diffusion unifiée omnimodale
Un backbone de diffusion masquée traite langage, vision, buts et actions comme des tokens discrets pour la robotique conditionnée par instructions.
arXiv cs.AI · cs.LG · cs.CL·Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim·11 septembre 2026
Lu et jugé par Fellow · impact léger
Article de recherche validé sur arXiv avec résultats expérimentaux et benchmarks, sans implémentation publique ni disponibilité immédiate.

Image · Source originale
Dynin-Robotics utilise Dynin-Omni, un backbone de diffusion masquée omnimodale, pour unifier prédiction d'action, d'observation future, de but terminal et reconstruction d'instructions. Pré-entraîné sur 1,33 million de trajectoires issues de 48 datasets Open X-Embodiment, il améliore l'adaptation en aval et le taux de succès sur instructions modifiées. Le modèle obtient des performances compétitives sur LIBERO et LIBERO-Plus en zero-shot.