Toutes les news taguées avec ce sujet.
vLLM ajoute le support du décodage spéculatif pour les GPU AMD, promettant une accélération de l'inférence LLM sur cette plateforme.
Une analyse technique détaillée de l'architecture de vLLM, moteur d'inférence open-source devenu référence pour servir des LLM à grande échelle.