vLLM

IA / LLM 🔴 Senior

Définition

Moteur d'inférence et de service haute performance né au Sky Computing Lab de Berkeley : PagedAttention gère la mémoire des clés/valeurs comme des pages, le continuous batching agrège les requêtes en vol, plus chunked prefill et prefix caching. Il expose un serveur compatible OpenAI (vllm serve, /v1/chat/complétions, /v1/embeddings) et l'API Anthropic Messages (/v1/messages).

Analogie

Un restaurant qui remplit chaque table dès qu'une place se libère au lieu d'attendre que tout le service soit fini.

Exemple de code

# Servir un modèle open-weights sur GPU avec l'API compatible OpenAI
pip install vllm
vllm serve mistralai/Mistral-Small-4 \
  --dtype bfloat16 \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.9 \
  --api-key sk-local

# Le client OpenAI pointe simplement vers le serveur
curl http://localhost:8000/v1/chat/completions \
  -H 'Authorization: Bearer sk-local' -H 'content-type: application/json' \
  -d '{"model":"mistralai/Mistral-Small-4","messages":[{"role":"user","content":"Bonjour"}]}'

Cas d'usage

Héberger soi-même un modèle open-weights pour des centaines d'utilisateurs, à débit élevé et coût GPU maîtrisé.

Anti-pattern

Utiliser vLLM pour un poste de développeur seul : Ollama ou llama.cpp suffisent et s'installent en une commande.
#ia#open-weights#production#performance

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre