GGUF

IA / LLM 🔴 Senior

Définition

Format binaire de fichier de modèle conçu pour l'inférence avec GGML/llama.cpp, successeur de GGML, GGMF et GGJT. Un seul fichier auto-suffisant, métadonnées clé-valeur extensibles, alignement des tenseurs pour le chargement par mmap, et prise en charge de nombreux schémas de quantification (Q4_0, Q5_K_M, Q8_0…). C'est le format qu'Ollama et LM Studio consomment.

Analogie

Le conteneur maritime des modèles : un format unique, empilable, qu'on charge sans déballer.

Exemple de code

# Convertir des poids Hugging Face en GGUF puis quantifier (llama.cpp)
python convert_hf_to_gguf.py ./Qwen3.8-27B --outfile qwen-f16.gguf
./llama-quantize qwen-f16.gguf qwen-Q4_K_M.gguf Q4_K_M

# Servir le fichier avec llama.cpp (API compatible OpenAI, port 8080)
./llama-server -m qwen-Q4_K_M.gguf -c 32768 --port 8080

# Ou l'importer dans Ollama via un Modelfile
cat > Modelfile <<'EOF'
FROM ./qwen-Q4_K_M.gguf
PARAMETER temperature 0.2
EOF
ollama create qwen-local -f Modelfile

Cas d'usage

Distribuer un modèle quantifié prêt à l'emploi ; choisir le bon compromis taille/qualité (Q4_K_M est le défaut courant).

Anti-pattern

Prendre un Q2 « parce que ça tient en RAM » : la perte de qualité est brutale sur les petits modèles.
#ia#open-weights#local

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre