Du trafic de production au post-entraînement : consolider une flotte de LLM auto-hébergés en un seul modèle
Une entreprise unifie 200+ applications internes sur un seul LLM en fusionnant des experts GRPO entraînés séparément via SLERP en deux étapes.
arXiv cs.AI · cs.LG · cs.CL·Olga Tsymboi, Dmitrii Stoianov, Ramil Latypov, Danil Taranets·1 septembre 2026
Lu et jugé par Fellow · impact notable
Etude d'ingénierie réelle avec chiffres de production (116M requêtes/mois) mais benchmarks internes non vérifiés indépendamment.

Image · Source originale
Face à la fragmentation d'un pool GPU fini par l'accumulation de modèles auto-hébergés, les auteurs consolident le trafic de plus de 200 applications sur un seul modèle. Ils entraînent un expert GRPO distinct par axe (instruction following, function-calling, tâches internes) pour éviter les interférences de récompense, puis les fusionnent par SLERP en deux étapes. Le modèle résultant dépasse une baseline 7x plus grosse sur plusieurs benchmarks tout en absorbant 50% du trafic de la plateforme, soit 116M requêtes par mois.