SoftServe : une méthode quasi-Newton scalable pour le deep learning
Un nouvel optimiseur quasi-Newton promet des courbures positives garanties et de meilleures pertes qu'Adam, Muon ou SOAP sur des problèmes mal conditionnés.
arXiv cs.AI · cs.LG · cs.CL·Joohwan Ko, Tetiana Parshakova, Diana Cai, Robert M. Gower·1 octobre 2026

Image · Source originale
SoftServe est une famille de méthodes quasi-Newton conçue pour contourner les obstacles de non-convexité et de taille des modèles en deep learning, sans recherche linéaire ni correction de courbure ad hoc. Elle s'appuie sur des variantes diagonales et factorisées de Kronecker, ainsi que sur l'itération de Newton-Schulz couplée pour remplacer les décompositions matricielles coûteuses par des multiplications adaptées au GPU. Sur des réseaux récurrents, autoencodeurs profonds, PINNs et un modèle de diffusion physique de 136M de paramètres, SoftServe surpasse souvent Adam, Muon et SOAP.