Guidage sélectif par entropie : apprendre des politiques autonomes à partir de VLM enseignants imparfaits
SAGE interroge un VLM seulement en cas d'incertitude pour distiller une politique RL légère, autonome à l'évaluation.
arXiv cs.AI · cs.LG · cs.CL·Matteo Merler, Giovanni Bonetta, Davide Zago, Rossella Cancelliere·1 septembre 2026
Lu et jugé par Fellow · impact notable
Une méthode de distillation validée sur des tâches de navigation qui permet une autonomie complète à l'évaluation et réduit les coûts d'appel au VLM.

Image · Source originale
Les chercheurs proposent SAGE, un framework qui n'interroge un VLM enseignant que lorsque l'agent apprenant est incertain, puis distille ce guidage dans une politique de renforcement légère. La méthode pondère les suggestions du VLM selon leur utilité réelle mesurée par les avantages de l'environnement plutôt que de les traiter uniformément. Sur des tâches de navigation et de raisonnement visuel à récompense rare, la politique apprise fonctionne sans VLM à l'évaluation et surpasse parfois son enseignant, tout en réduisant fortement les appels au VLM pendant l'entraînement.