Toutes les news taguées avec ce sujet.
Une plate-forme 'end-to-end' dédiée à l'entraînement et à l'inférence de modèles à poids ouverts.
Des documents internes révèlent des pertes massives prévues avant une introduction potentielle en bourse.
L'infrastructure d'inférence nécessite une optimisation globale mémoire, stockage et réseau pour réduire latence et coûts.
Une startup issue du programme YC S26 dévoile une plateforme d'infrastructure destinée aux agents IA opérant dans des environnements physiques réels.
Une nouvelle plateforme cloud propose des H100 à 2,04 $/h et des H200 à 3 $/h.
Baseten explore les compromis entre coût, latence et débit pour optimiser le déploiement des LLM en production.
Annuaire technique et comparatif des processeurs graphiques pour l'IA et le gaming.
Le constructeur de Cupertino s'impose comme un acteur de l'infra IA grâce à cet achat massif.
Un billet de blog soutient que l'adoption de l'IA dans le développement logiciel exige de repenser d'abord les fondations d'infrastructure des équipes techniques.
La CFO Sarah Friar explique comment puces, calcul, modèles et produits s'additionnent pour rendre l'IA plus utile, plus accessible et moins coûteuse.
Hugging Face détaille l'architecture technique combinant Inference Endpoints, Jobs et Buckets pour propulser la fonction de recherche de Papers with Code.
NVIDIA détaille comment son CPU Vera vise à optimiser l'orchestration des workloads agentiques imprévisibles à l'échelle des data centers.
L'impact de l'IA sur les pratiques d'ingénierie et l'architecture système.
Vue d'approfondissement sur les conceptions matérielles optimisées pour l'entraînement et l'inférence.
Une opération d'envergure qualifiée de reverse-execuhire par les observateurs.
Un article explore les compromis techniques et financiers du déploiement de LLM en infrastructure locale plutôt que dans le cloud.
Un article technique détaille le rôle des générateurs diesel dans l'infrastructure énergétique des data centers, enjeu croissant avec l'essor de l'IA.
Startup YC proposant des machines virtuelles persistantes pour calcul intensif gérées en ligne de commande.
Optimiser l'inférence LLM pour lisser les pics de latence et garantir une expérience utilisateur fluide.
Un retour d'expérience montre comment réorganiser l'ordonnancement des tâches GPU améliore fortement le taux d'utilisation, sans matériel supplémentaire.
OpenAI annonce sa participation au projet PORTS-Pike, renforçant l'investissement communautaire dans le sud de l'Ohio.
L'acquisition de cette startup passerait de passerelle de paiement à hub central pour le routing IA.
Un billet technique distingue l'optimalité théorique du compute (à la Chinchilla) des contraintes réelles d'un cluster de calcul.
Analyse de l'impact de la consommation énergétique de l'IA sur les prix de l'électricité et les infrastructures.
Une nouvelle politique d'admission au niveau routage optimise le partage du cache KV entre RLVR, RLHF et rollouts agentiques lors du post-training des LLM.
Mistral renforce son offre d'IA souveraine avec de l'inférence localisée, des modèles open-weights et de nouveaux datacenters européens.
Une plateforme YC S26 facilitant l'achat et la location de puissance de calcul pour l'IA.
OpenAI réaffirme son engagement pour une infrastructure IA éthique et transparente au Texas.
L'entreprise constituerait une équipe interne dédiée au silicium pour réduire sa dépendance aux fournisseurs externes de puces IA.