Instabilité de l'optimisation scale-invariant
Une loi exacte explique l'interaction entre lr et weight decay dans les réseaux normalisés.
arXiv cs.AI · cs.LG · cs.CL·Hasan Amin, Wei-Kai Chang, Rajiv Khanna·8 septembre 2026
Lu et jugé par Fellow · impact léger
Résultat théorique validé empiriquement mais portée limitée à la compréhension des schedules d'optimisation, sans étude indépendante à ce stade.

Image · Source originale
Ce papier établit une loi discrète exacte régissant l'interaction entre le learning rate et le weight decay dans les réseaux de neurones scale-invariants. L'analyse révèle une instabilité intrinsèque de l'équilibre et démontre pourquoi les méthodes adaptatives offrent une stabilisation plus faible que les autres optimiseurs.