Un régime de données équilibré : lever le goulot d'exploration du RL à très grande échelle pour le contrôle de robots
Success Guided Sampling (SGS) concentre l'entraînement RL sur la frontière des capacités de la politique et rend exploitable le scaling jusqu'à plus d'un million d'environnements parallèles.
arXiv cs.AI · cs.LG · cs.CL·Octi Zhang, Mateo Guaman Castro, Patrick Yin, Ignacio Dagnino·8 octobre 2026
Lu et jugé par Fellow · impact notable
Papier CoRL 2026 avec méthode simple (SGS), expériences jusqu'à 2^20 environnements et transfert zero-shot sur matériel réel ; avance incrémentale sans validation indépendante.

Image · Source originale
Les auteurs observent que l'échantillonnage uniforme des resets de simulateur gaspille une part croissante de l'expérience sur des configurations déjà maîtrisées ou hors de portée. Ils proposent Success Guided Sampling (SGS), un échantillonneur adaptatif ciblant la frontière des capacités de la politique. Testé jusqu'à 2^20 environnements parallèles, SGS permet au RL de résoudre des tâches difficiles de locomotion quadrupède multi-terrains.