Des lois d'échelle pour les Mixture-of-Experts en boucle
Une nouvelle loi d'échelle modélise conjointement récurrence et sparsité, et prédit plus finement les performances des modèles MoE bouclés.
arXiv cs.AI · cs.LG · cs.CL·Yanbei Chen, Anirudh Goyal, Raghuraman Krishnamoorthi·30 septembre 2026

Image · Source originale
Les chercheurs introduisent les « Loop Scaling Laws », premières lois d'échelle à combiner récurrence (transformers en boucle) et sparsité (Mixture-of-Experts). Elles prédisent mieux la perte des modèles bouclés que les approches existantes et englobent les lois classiques comme cas particuliers. À taille de calcul équivalente, un MoE bouclé égale un MoE non bouclé deux fois plus grand sur des benchmarks de raisonnement, tout en permettant du test-time scaling via la récurrence.