Allocation optimale du budget SFT-RL : de petits à grands LLM
Une méthode transposable détermine la répartition idéale des données SFT et RL sans recherche exhaustive.
arXiv cs.AI · cs.LG · cs.CL·Jingtan Wang, Arun Verma, Xiaoqiang Lin, Zhengyuan Liu·1 septembre 2026
Lu et jugé par Fellow · impact léger
Étude méthodologique acceptée à EMNLP 2026, résultat empirique utile mais de portée limitée à l'allocation SFT-RL en post-training.

Image · Source originale
Ce cadre définit la région quasi-optimale pour allouer un budget d'annotation entre SFT et RL lors du post-training. Expérimentalement, cette région s'élargit avec l'échelle du modèle et se transfère fiablement des petits modèles proxies aux grands modèles cibles.