ROBORMBENCH : la fragilité des modèles de récompense vision-langage face aux paraphrases
Une simple reformulation de la consigne peut inverser le verdict succès/échec d'un modèle de récompense VLM pour une trajectoire robotique identique.
arXiv cs.AI · cs.LG · cs.CL·Wonje Jeung, Sangyeon Yoon, Hyesoo Hong, Yoonjun Cho·4 septembre 2026
Lu et jugé par Fellow · impact notable
Benchmark massif (2390 trajectoires) prouvant l'instabilité des modèles de récompense VLM face aux paraphrases.

Image · Source originale
Les auteurs introduisent ROBORMBENCH, un benchmark de 2 390 trajectoires réelles avec 21 673 paraphrases vérifiées, pour tester l'invariance des modèles vision-langage utilisés comme fonctions de récompense en robotique. Ils montrent que ces modèles sont largement instables face à des reformulations sémantiquement équivalentes, un problème que ni l'échelle ni le raisonnement explicite ne résolvent. Des modèles de récompense entraînés spécifiquement avec supervision ancrée sur les trajectoires s'avèrent nettement plus robustes.