ReflectRL : tirer parti des échecs experts via réflexion
Un framework plug-and-play convertit les erreurs de modèles experts en signaux d'apprentissage pour améliorer le raisonnement.
arXiv cs.AI · cs.LG · cs.CL·Jinhe Bi, Chennan Zhou, Zengjie Jin, Aniri·4 août 2026

Image · Source originale
ReflectRL est un framework on-policy qui exploite les trajectoires négatives d'experts, nommées Golden Negative Trajectories. Au lieu d'écarter ces échecs, le système les utilise pour déclencher un raisonnement réflexif, puis transfère ces acquis au raisonnement direct. Les tests sur 9 benchmarks et 4 LLM montrent une amélioration constante des performances avec une surcharge minimale.
#rlhf#reasoning#on-policy#llm-training