QF3 : un RL rapide pour politiques de flow avec gradients Q filtrés
Un nouvel algorithme off-policy accélère l'apprentissage par renforcement des politiques de flow, avec transfert zero-shot vers des robots humanoïdes réels.
arXiv cs.AI · cs.LG · cs.CL·Chung Min Kim, Brent Yi, David McAllister, Hongsuk Choi·6 octobre 2026
Lu et jugé par Fellow · impact notable
Nouveau RL off-policy pour flow policies, premier transfert zero-shot sur locomotion humanoïde réelle avec gain x10 vs FPO++, résultat technique vérifiable.

Image · Source originale
QF3 entraîne des politiques de flow via flow matching combiné au gradient d'action du critique, en limitant ce gradient aux dimensions proches de l'action en mémoire pour fiabiliser l'apprentissage. Première méthode off-policy à entraîner des politiques de locomotion humanoïde from scratch avec transfert direct sur matériel réel, elle offre un gain de vitesse de 10x par rapport à FPO++. QF3 permet aussi d'affiner des politiques de manipulation pré-entraînées sur ABC-Sim et Robomimic.