ExpDis : découpler exploration et optimisation dans l'apprentissage par renforcement avec récompenses vérifiables
Des chercheurs proposent un cadre qui sépare la phase d'exploration de celle d'optimisation en RLVR, permettant d'intensifier l'exploration sans dégrader la qualité du modèle final.
arXiv cs.AI · cs.LG · cs.CL·Saif Punjwani, Micah Goldblum·7 octobre 2026
Lu et jugé par Fellow · impact notable
Méthode RLVR concrète avec code et checkpoints publiés, résultats sur 7 benchmarks et 2 familles de modèles, mais sans évaluation indépendante ni déploiement industriel avéré.

Image · Source originale
L'apprentissage par renforcement avec récompenses vérifiables (RLVR) peine à découvrir de nouvelles stratégies de raisonnement malgré les incitations à la nouveauté. Les auteurs présentent ExpDis (Exploration-Distillation), un cadre qui découple exploration et optimisation : des politiques exploratrices sont entraînées avec un bonus de nouveauté, leurs trajectoires sont filtrées puis distillées dans une politique étudiante entraînée sans ce bonus. Sur sept benchmarks de raisonnement mathématique et deux familles de modèles, ExpDis surpasse DAPO à budget égal, avec un meilleur scaling pass@k indiquant une plus grande diversité des solutions correctes.