Vers des modèles en boucle réussis (partie II) : repenser l'entraînement aux points fixes
Une méthode d'entraînement améliore les modèles de langage en boucle, réduisant le cache KV et accélérant prefill et RL sans perte de précision.
arXiv cs.AI · cs.LG · cs.CL·Benhao Huang, Chufan Shi, Junlin Chen, Shicheng Wen·5 octobre 2026
Lu et jugé par Fellow · impact léger
Amélioration technique incrémentale d'une architecture de niche (modèles en boucle), testée jusqu'à 1,6B paramètres seulement.

Image · Source originale
Les auteurs proposent un a priori de profondeur appris et une injection orthogonale pour mieux façonner les points fixes des modèles de langage en boucle. Ces améliorations permettent un partage de cache KV terminal, un préremplissage jusqu'à 1,79x plus rapide et des mises à jour RL deux fois plus rapides. De 100M à 1,6B de paramètres, la perplexité diminue à chaque échelle par rapport aux approches existantes.