Toutes les news taguées avec ce sujet.
Georgi Gerganov réagit à l'acquisition d'HuggingFace par Nvidia et évoque l'impact sur le développement futur de llama.cpp et ggml.
Llama.cpp adopte le paramètre 'medium' par défaut pour le modèle Qwen3.8-27B.
Georgi Gerganov publie la version initiale de llama.cpp, portant l'inférence LLM sur CPU.
Le projet permet l'inférence de LLM sur CPU et Apple Silicon via une implémentation optimisée en C++.
L'utilisation du GPU passthrough sur macOS VM optimise l'inférence avec Llama.cpp.