Toutes les news taguées avec ce sujet.
NVIDIA officialise son support du Rust pour la programmation GPU native avec deux approches distinctes.
Nvidia met la main sur la plateforme de référence des modèles open-weights, un signal fort dans la course à l'infrastructure IA.
Georgi Gerganov réagit à l'acquisition d'HuggingFace par Nvidia et évoque l'impact sur le développement futur de llama.cpp et ggml.
NVIDIA permet désormais le déploiement de modèles de raisonnement complexes directement sur le matériel Edge via Jetson.
NVIDIA présente un agent « Chief of Staff » qui conserve un modèle de soi lisible pour contextualiser son travail en entreprise dans la durée.
NVIDIA présente PAIR, un système qui répartit l'inférence entre appareils d'un même réseau pour soutenir les workflows multi-agents.
Une rumeur d'acquisition de la plateforme communautaire d'IA par Nvidia circule, sans confirmation officielle à ce stade.
Troisième volet d'une série sur le co-design de modèles IA, avec cinq règles pratiques pour choisir la longueur et le mécanisme de draft.
NVIDIA détaille une méthode concrète pour optimiser du code CUDA, entre profilage, bibliothèques modernes et bonnes pratiques de performance.
NVIDIA propose une méthode pour calibrer les ressources GPU d'inférence face aux contraintes de latence, de trafic et de budget.
NVIDIA rend disponibles ses microservices BioNeMo NIM au sein de Claude Science pour accélérer les workflows de recherche en biologie assistés par IA agentique.
Le constructeur développe un écosystème logiciel complet pour sécuriser sa suprématie face à la concurrence.
Analyse technique des défauts des GPU Nvidia pour l'inférence et présentation de l'architecture du processeur OpenAI Jalapeño.
Le géant du GPU serait en discussions rapprochées pour racheter l'acteur central de l'open-source pour environ 13 milliards de dollars.
Face aux doutes sur la soutenabilité financière de la bulle IA, Nvidia défend sa capacité à maintenir des marges records et à financer l'expansion du secteur.
NVIDIA simplifie le déploiement de modèles open via TensorRT Model Connect, automatisant conversion et runtime.
OpenAI dévoile son puce inference Jalapeño, surpassant NVIDIA en efficacité énergétique lors de la conférence Hot Chips.
Un billet technique NVIDIA explique comment doter des robots hétérogènes d'une navigation autonome grâce à des agents IA et à la simulation.
Le géant des puces finalise le rachat pour 80x le ARR, tandis que Z.ai lance le modèle GLM-5.3 Flash.
NVIDIA étend NVLink Fusion pour connecter sa mémoire à haute bande passante aux accélérateurs IA personnalisés des hyperscalers.
Un nouvel ordinateur portable embarque un agent IA fonctionnant entièrement en local, promettant de s'affranchir des frais liés aux API cloud.
Analyse de la répartition des risques de crédit dans la plateforme de financement de 500 milliards de dollars mise en place par Nvidia.
Alibaba dévoile les poids de Qwen3.8-Flash-Next, un aperçu de l'architecture Qwen4, expérimenté par NVIDIA sur ses puces GB300 NVL72.
NVIDIA Dynamo intègre une fonctionnalité de récupération 'shadow engine' pour restaurer les capacités d'inférence en quelques secondes.
NVIDIA stabilise son bridge Python pour CUDA, offrant un accès direct et natif au GPU sans passer par des couches d'abstraction tierces.
Une nouvelle puce présentée comme offrant une vitesse d'inférence de pointe pour les workloads d'agents IA entre en production à grande échelle.
NVIDIA dévoile le processeur Groq 3 LPX pour l'accélération de l'inférence interactive sur la plateforme Vera Rubin NVL72.
Une variante optimisée pour l'espace du supercalculateur Nvidia Vera Rubin NVL72 serait développée avec SpaceX, avec un lancement en orbite envisagé fin d'année.
Les premiers résultats de performance des puces Groq 3 apportent des indices, mais laissent aussi de nombreuses questions sans réponse sur l'investissement massif de Nvidia.
NVIDIA détaille comment son CPU Vera vise à optimiser l'orchestration des workloads agentiques imprévisibles à l'échelle des data centers.