Toutes les news taguées avec ce sujet.
Une étude montre que les modèles entraînés avec l'optimiseur Muon apprennent plus vite mais perdent leur généralisation après le grokking.