Effondrement post-grokking à l'interface représentation-lecture dans les transformers entraînés avec Muon
Une étude montre que les modèles entraînés avec l'optimiseur Muon apprennent plus vite mais perdent leur généralisation après le grokking.
arXiv cs.AI · cs.LG · cs.CL·Ali Janati, Kaoutar El Maghraoui, Andrei Kanavalau, Anass Belfatmi·7 août 2026

Image · Source originale
Les chercheurs identifient une instabilité systématique dans les transformers entraînés avec Muon sur des tâches arithmétiques modulaires : après le grokking, les modèles perdent leur généralisation. Le problème se situe à l'interface entre les représentations internes et la couche de lecture, où Muon et AdamW réagissent différemment aux gradients résiduels. Geler les embeddings ou la tête de sortie élimine totalement l'échec, tandis que retirer la normalisation de Muon aggrave l'effondrement des représentations.