Toutes les news taguées avec ce sujet.
vLLM ajoute le support du décodage spéculatif pour les GPU AMD, promettant une accélération de l'inférence LLM sur cette plateforme.