RECHERCHE
Off-Context GRPO : apprendre à raisonner sur des problèmes difficiles
Une variante du GRPO utilisant des informations privilégiées guide le modèle vers des solutions correctes sans déstabiliser l'apprentissage.
arXiv cs.AI · cs.LG · cs.CL·Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari·21 juillet 2026

Image · Source originale
Le Off-Context GRPO (OC-GRPO) améliore le raisonnement des LLM sur des problèmes difficiles en utilisant des rollouts guidés par des informations privilégiées. L'algorithme corrige l'objectif par importance pour éviter le mismatch entre données guidées et non guidées. Il surpasse le GRPO standard de 3,9 % sur les benchmarks mathématiques.