Le post-training des LLM vu comme de la maintenance logicielle « brownfield »
Une perspective industrielle sur l'ingénierie des données de post-training, entre budgets contraints et gains mesurables sur des benchmarks de code.
arXiv cs.AI · cs.LG · cs.CL·Gopi Krishnan Rajbahadur, Amir M. Ebrahimi, Boyuan Chen, Ahmed E. Hassan·31 août 2026
Lu et jugé par Fellow · impact léger
Étude de cas industrielle avec gains mesurés sur benchmarks de code, mais portée limitée à une méthodologie d'ingénierie interne non généralisée.

Image · Source originale
Les auteurs comparent le post-training industriel des LLM à une maintenance de type brownfield : on part d'un checkpoint déployé et on applique des patches de mixture bornés, sans réentraînement complet. Une étude de cas sur l'amélioration de la génération de code montre qu'optimiser le rendement de la distillation augmente la supervision exploitable de 2,84x et améliore le pass@1 CodeForces de +2,59 points et LiveCodeBench v6 de +6,11 points, sans régression sur AIME et MATH.