Améliorer l'exploration LLM par guidage de modèles faibles en RLVR
Une méthode perturbe les trajectoires via des modèles plus faibles pour préserver la diversité et la couverture du raisonnement.
arXiv cs.AI · cs.LG · cs.CL·Xingyu Shen, Huishuai Zhang, Peng Li, Yinchun Wang·27 août 2026
Lu et jugé par Fellow · impact léger
Papier de recherche proposant une méthode expérimentale sans implémentation ni adoption industrielle immédiate.

Image · Source originale
Cette étude introduit une méthode pour préserver la diversité générative des LLM lors de l'entraînement par RLVR. En utilisant des préfixes de raisonnement issus de modèles plus faibles, elle évite l'effondrement de l'entropie et améliore le pass@k. Les expériences sur des benchmarks mathématiques montrent une meilleure couverture du raisonnement sans SFT supplémentaire.