PaperGym : un environnement d'entraînement basé sur des rubriques pour générer des plans de recherche
Un nouveau framework transforme les papiers scientifiques en environnements d'entraînement RL pour évaluer la planification de recherche des IA, sans fuite de critères.
arXiv cs.AI · cs.LG · cs.CL·Yuhan Wang, Zhengxi Lu, Yuchen Yan, Kaitao Song·31 août 2026
Lu et jugé par Fellow · impact léger
Nouveau benchmark et méthode RL avec code et données publiés, mais résultats limités à Qwen3 sur cinq benchmarks spécifiques.

Image · Source originale
PaperGym sépare la question (issue de l'objectif et du contexte) des critères d'évaluation (issus de la méthode et des expériences), réduisant les fuites de critères à 3,7% contre 11,9-34,1% dans les jeux de données existants. Entraînés sur Qwen3-1.7B/4B/8B avec la rubrique utilisée deux fois (self-teacher puis reward GRPO), les modèles surpassent le fine-tuning supervisé de 4,8 à 5,6 points en moyenne sur cinq benchmarks. Le Qwen3-8B entraîné atteint 73,48 sur ResearchQA, devançant Kimi K2.6, un modèle bien plus grand.