Mise à l'échelle par blocs UE5M3 FP4 pour un pré-entraînement stable des LLM
Un nouveau schéma de quantification FP4 simplifie le pré-entraînement en basse précision et améliore les performances face à la recette NVIDIA existante.
arXiv cs.AI · cs.LG · cs.CL·Robert Hu, Carlo Luschi, Paul Balanca·2 septembre 2026
Lu et jugé par Fellow · impact notable
Validation sur 8B tokens montrant une perte finale plus basse et un gain de débit de 21,2% face à la recette NVIDIA.

Image · Source originale
Des chercheurs proposent une méthode combinant des payloads E2M1 avec des échelles de bloc E5M3 non signées pour stabiliser le pré-entraînement en FP4, sans transformée de Hadamard aléatoire. Testée sur un modèle Nemotron-H 8B entraîné sur près de 190 milliards de tokens, cette approche obtient une perte finale plus basse et de meilleures performances en aval que la recette Transformer Engine de NVIDIA, tout en augmentant le débit de traitement de 21,2%.