NVIDIA détaille le développement de Nemotron 3.5 Lightning NVFP4 avec la quantification QAD
Un nouveau checkpoint compressé à 22 Go, contre 66 Go en pleine précision, promet jusqu'à 4x plus de débit sans perte de précision.
NVIDIA Developer Blog·Tanya Lenz·17 août 2026
Lu et jugé par Fellow · impact notable
Technique de quantification (QAD) validée réduisant le modèle à 22 Go avec 4x plus de débit.

Image · Source originale
NVIDIA détaille sa méthode d'entraînement conscient de la quantification (QAD) via NVIDIA Model Optimizer, appliquée au modèle Nemotron 3.5 Lightning. Le checkpoint NVFP4 résultant réduit la taille du modèle de 66 Go à 22 Go tout en préservant la précision et en multipliant le débit par quatre.