GGUF
IA / LLM 🔴 SeniorDéfinition
Format binaire de fichier de modèle conçu pour l'inférence avec GGML/llama.cpp, successeur de GGML, GGMF et GGJT. Un seul fichier auto-suffisant, métadonnées clé-valeur extensibles, alignement des tenseurs pour le chargement par mmap, et prise en charge de nombreux schémas de quantification (Q4_0, Q5_K_M, Q8_0…). C'est le format qu'Ollama et LM Studio consomment.
Analogie
Le conteneur maritime des modèles : un format unique, empilable, qu'on charge sans déballer.
Exemple de code
# Convertir des poids Hugging Face en GGUF puis quantifier (llama.cpp)
python convert_hf_to_gguf.py ./Qwen3.8-27B --outfile qwen-f16.gguf
./llama-quantize qwen-f16.gguf qwen-Q4_K_M.gguf Q4_K_M
# Servir le fichier avec llama.cpp (API compatible OpenAI, port 8080)
./llama-server -m qwen-Q4_K_M.gguf -c 32768 --port 8080
# Ou l'importer dans Ollama via un Modelfile
cat > Modelfile <<'EOF'
FROM ./qwen-Q4_K_M.gguf
PARAMETER temperature 0.2
EOF
ollama create qwen-local -f Modelfile
Cas d'usage
Distribuer un modèle quantifié prêt à l'emploi ; choisir le bon compromis taille/qualité (Q4_K_M est le défaut courant).
Anti-pattern
Prendre un Q2 « parce que ça tient en RAM » : la perte de qualité est brutale sur les petits modèles.
Termes liés
Sources
Fiche mise à jour le 2026-09-27