Toutes les news taguées avec ce sujet.
NVIDIA présente PAIR, un système qui répartit l'inférence entre appareils d'un même réseau pour soutenir les workflows multi-agents.
Baseten explore les compromis entre coût, latence et débit pour optimiser le déploiement des LLM en production.
NVIDIA propose une méthode pour calibrer les ressources GPU d'inférence face aux contraintes de latence, de trafic et de budget.
OpenAI présente les performances de Jalapeño, sa puce maison, avec des gains annoncés en vitesse et en efficacité énergétique pour l'inférence.
Une nouvelle puce présentée comme offrant une vitesse d'inférence de pointe pour les workloads d'agents IA entre en production à grande échelle.
Liquid AI dévoile LFM2.5-DSpark, une nouvelle version de son modèle optimisée pour accélérer l'inférence sur une large gamme de matériel.
Une méthode statistique pour garantir la fiabilité physique du support obtenu par sparse pursuit, même quand le dictionnaire appris est ambigu.
Une méthode qui optimise directement les pas d'échantillonnage des modèles de diffusion, sans entraînement supplémentaire, pour accélérer la génération jusqu'à 10x.
Le fabricant de puces spécialisées annonce la prochaine génération de son système de calcul dédié à l'IA à grande échelle.
Un nouveau checkpoint compressé à 22 Go, contre 66 Go en pleine précision, promet jusqu'à 4x plus de débit sans perte de précision.
Cerebras annonce une collaboration avec OpenAI pour exécuter une variante rapide de GPT-5.6 sur son infrastructure spécialisée.
Mistral renforce son offre d'IA souveraine avec de l'inférence localisée, des modèles open-weights et de nouveaux datacenters européens.
Une analyse technique détaillée de l'architecture de vLLM, moteur d'inférence open-source devenu référence pour servir des LLM à grande échelle.