Toutes les news taguées avec ce sujet.
Hugging Face intègre un backend transformers natif dans vLLM, permettant d'atteindre des vitesses d'inférence optimales sans surcoût de conversion.
Une approche multi-agents légère intégrée à l'API de vLLM permettrait de dépasser les performances des grands modèles frontier sans coût supplémentaire.
Hugging Face simplifie le déploiement d'inférence à grande échelle : un serveur vLLM opérationnel en une ligne de commande via HF Jobs.