Le weight tying est-il toujours utile pour les LLM decoder-only entraînés sous DP-SGD ?
Une étude sur GPT2 et DistilGPT2 montre que délier les embeddings améliore précision et efficacité mémoire en entraînement différentiellement privé.
arXiv cs.AI · cs.LG · cs.CL·Razan El Mais, Ali Chehab, Ibrahim Issa, Razane Tajeddine·30 septembre 2026
Lu et jugé par Fellow · impact léger
Résultat empirique spécifique sur GPT2/DistilGPT2 sous DP-SGD, utile mais de portée limitée à ce cadre expérimental.

Image · Source originale
Les auteurs examinent l'impact du weight tying sous DP-SGD avec GPT2 et DistilGPT2. Les modèles à embeddings déliés surpassent systématiquement les versions à poids liés, avec jusqu'à 4,74 points d'accuracy en plus sur SST-2, QNLI et QQP. Ils permettent aussi d'utiliser le ghost clipping de façon plus efficace, réduisant l'usage mémoire de plus de 60%.