Quantization des LLM : pourquoi mieux vaut répartir la précision globalement
Une étude sur 9 modèles open-weights montre que les dégâts de la quantization sont diffus, pas localisés, et que la granularité globale bat les réparations ciblées.
arXiv cs.AI · cs.LG · cs.CL·Jundong Hu, Shekar Ramachandran·1 septembre 2026
Lu et jugé par Fellow · impact notable
Étude causale sur 9 modèles montrant qu'une granularité fine globale bat la réparation ciblée par 21-52 points, résultat vérifiable mais préprint non encore peer-reviewé.

Image · Source originale
Des chercheurs testent trois hypothèses sur l'origine des pertes de précision liées à la quantization post-entraînement (PTQ) des LLM, sans qu'aucune ne prédise correctement les couches à restaurer. La récupération de précision s'avère diffuse pour 8 modèles sur 9, sauf Qwen3-8B. À budget égal, allouer la précision globalement via une granularité plus fine surpasse la réparation sélective des couches, de 21 à 52 points.