Toutes les news taguées avec ce sujet.
Une discussion technique explore ce que recouvre réellement le paramètre 'effort' proposé par certains fournisseurs de LLM.
Un partenariat pour une inférence ultra-rapide à haut débit.
Un modèle 48B en open-weights optimisé pour l'efficience.
Hugging Face intègre Nunchaku pour accélérer l'inférence Stable Diffusion via la quantification 4-bit.
NVIDIA ajoute un suivi de progression et une annulation à la volée pour les longues compilations de moteurs TensorRT.
Analyse technique des méthodes pour optimiser les ressources de calcul.
Une nouvelle méthode de gestion mémoire pour les modèles MoE promet jusqu'à 72% d'économies GPU sans perte de précision.
Un projet démontre une inférence de classification d'images entièrement chiffrée, avec un temps de calcul ramené à 200 millisecondes.
Inférence d'un modèle 26B sur du matériel obsolète via optimisation logicielle.
Une méthode sans apprentissage pour conditionner divers modèles stochastiques complexes via des SDE rétrogrades.
Un projet open source propose un moteur d'inférence bas niveau optimisé pour faire tourner Qwen 3.6 35B sur les GPU Blackwell.
Microsoft Azure AI Foundry intègre les modèles Hugging Face via un service de calcul managé, simplifiant le déploiement en production.
PAW compile des spécifications en langage naturel en adaptateurs légers exécutables localement, rivalisant avec un LLM 32B avec 50× moins de mémoire.
Une approche multi-agents légère intégrée à l'API de vLLM permettrait de dépasser les performances des grands modèles frontier sans coût supplémentaire.
Une analyse critique de l'évolution du tokenmaxxing dans les systèmes agentiques : la stratégie est-elle dépassée ou en mutation ?
NVIDIA introduit le support multi-GPU dans TensorRT pour répondre aux besoins croissants des pipelines de génération de médias en production.
OpenAI et Broadcom annoncent conjointement Jalapeño, un chip IA personnalisé conçu spécifiquement pour l'inférence de grands modèles de langage.
NVIDIA détaille comment l'optimisation conjointe de l'inférence et de l'entraînement permet de réduire le coût énergétique par token dans les AI factories.
NVIDIA présente DAQIRI, un framework permettant d'intégrer l'inférence IA directement dans les pipelines d'acquisition de données scientifiques à haute fréquence.