Cliff : apprentissage des récompenses par processus dès la première erreur
Une nouvelle méthode RLVR identifie la première erreur de raisonnement pour guider l'entraînement des LLM.
arXiv cs.AI · cs.LG · cs.CL·Peixuan Han, Runhui Wang, Ketan Ramaneti, Jie Hao·2 septembre 2026
Lu et jugé par Fellow · impact léger
Amélioration incrémentale mesurée (+15%/+7%) sur méthode RLVR, mais paper unique, non repris, sans vérification indépendante.

Image · Source originale
Cliff est une stratégie de reward shaping pour le RLVR qui utilise un LLM pour détecter la première erreur dans un raisonnement. Elle décompose le processus en préfixe correct et suffixe incorrect, convertissant ce signal en avantages au niveau des tokens. Les expériences montrent une amélioration des performances de 15% par rapport à la distillation on-policy.