SGD décentralisé sous bruit à queue lourde : taux de convergence optimaux et rôle du gradient clipping
Des chercheurs démontrent que le clipping permet d'atteindre des taux de convergence optimaux pour l'optimisation décentralisée non convexe sous bruit à moments bornés, avec accélération linéaire en nombre d'agents.
arXiv cs.AI · cs.LG · cs.CL·Aleksandar Armacki, Haoyuan Cai, Ali H. Sayed·7 octobre 2026
Lu et jugé par Fellow · impact notable
Résultat théorique solide (taux optimaux + accélération linéaire pour DSGD clippé sous bruit à queue lourde) avec preuve mathématique complète, mais sans implémentation ni benchmark sur données réelles ; avancée incrémentale dans un domaine déjà actif.

Image · Source originale
Cette étude analyse le SGD décentralisé (DSGD) avec gradient clipping sous bruit à queue lourde, un phénomène fréquent en apprentissage profond. Les auteurs établissent des taux de convergence optimaux, à la fois en espérance et avec forte probabilité, pour des coûts non convexes lisses sous bruit à p-ième moment borné (p ∈ (1,2]). Ils démontrent également une accélération linéaire en nombre d'agents, une première pour les méthodes décentralisées avec clipping. L'analyse repose sur une borne fine du gap de consensus exploitant la structure du clipping, qui relègue les effets de réseau à des termes d'ordre supérieur. Les résultats mettent en évidence une distinction clé : le clipping préserve l'information de magnitude, contrairement à la normalisation qui peut échouer à converger dans ce cadre.
#optimisation#apprentissage-fédéré#sgd-décentralisé#gradient-clipping#bruit-à-queue-lourde