Toutes les news taguées avec ce sujet.
Un projet démontre la faisabilité de faire tourner un petit modèle LLM sur ESP32, un microcontrôleur à très bas coût.
Hugging Face intègre Nunchaku pour accélérer l'inférence Stable Diffusion via la quantification 4-bit.
Une nouvelle méthode de gestion mémoire pour les modèles MoE promet jusqu'à 72% d'économies GPU sans perte de précision.
La précision et la perplexité ne suffisent pas à évaluer la quantization : une nouvelle métrique comportementale révèle des divergences invisibles.
NVIDIA détaille comment le format NVFP4 4-bit de l'architecture Blackwell permet de compresser Nemotron Ultra sans sacrifier les performances.