Toutes les news taguées avec ce sujet.
Un nouveau schéma de quantification FP4 simplifie le pré-entraînement en basse précision et améliore les performances face à la recette NVIDIA existante.
Un article de forum décortique les réglages techniques négligés qui plombent silencieusement les performances des LLM exécutés en local.
Un nouveau checkpoint compressé à 22 Go, contre 66 Go en pleine précision, promet jusqu'à 4x plus de débit sans perte de précision.