Reformuler avant d'agir : caractériser et atténuer la sensibilité linguistique des modèles vision-langage-action
Les modèles VLA perdent la robustesse linguistique de leurs fondations VLM. Une simple reformulation d'instruction peut faire varier le taux de succès de plusieurs dizaines de points. Les auteurs proposent une méthode de réécriture zero-shot sans réentraînement.
arXiv cs.AI · cs.LG · cs.CL·Mikey Watts, Yuchen Cui·7 octobre 2026
Lu et jugé par Fellow · impact notable
Article de recherche avec résultats chiffrés et vérifiables (gains de 16-27% relatif sur π₀, réplication sur π₀.₅ et LIBERO), mais méthode incrémentale sans réentraînement ni changement de paradigme — amélioration d'un modèle existant, pas une percée fondamentale.

Image · Source originale
Les modèles vision-langage-action (VLA) présentent une sensibilité marquée à la formulation des instructions, contrairement aux modèles vision-langage dont ils héritent. Les auteurs caractérisent ce phénomène par des tests statistiques de variations ponctuelles et une recherche oracle de formulations, montrant que le phrasé seul peut combler l'écart de 21 points entre tâches en distribution et hors distribution. Ils proposent ensuite une méthode de mitigation sans modifier la politique : un LLM distille des règles de reformulation à partir de scores sur plusieurs formulations, puis réécrit chaque instruction entrante à la volée. Les règles améliorent le modèle figé π₀ de 16 à 27 % en relatif sur douze tâches de test, avec des gains concentrés sur les tâches hors distribution. La méthode se réplique sur π₀.₅ et LIBERO, portant le succès en fine-tuning de 93,6 % à 97,8 %.
#vla#vision-language-action#robustesse-linguistique#zero-shot#robotique#reformulation