vLLM
IA / LLM 🔴 SeniorDéfinition
Moteur d'inférence et de service haute performance né au Sky Computing Lab de Berkeley : PagedAttention gère la mémoire des clés/valeurs comme des pages, le continuous batching agrège les requêtes en vol, plus chunked prefill et prefix caching. Il expose un serveur compatible OpenAI (vllm serve, /v1/chat/complétions, /v1/embeddings) et l'API Anthropic Messages (/v1/messages).
Analogie
Un restaurant qui remplit chaque table dès qu'une place se libère au lieu d'attendre que tout le service soit fini.
Exemple de code
# Servir un modèle open-weights sur GPU avec l'API compatible OpenAI
pip install vllm
vllm serve mistralai/Mistral-Small-4 \
--dtype bfloat16 \
--max-model-len 32768 \
--gpu-memory-utilization 0.9 \
--api-key sk-local
# Le client OpenAI pointe simplement vers le serveur
curl http://localhost:8000/v1/chat/completions \
-H 'Authorization: Bearer sk-local' -H 'content-type: application/json' \
-d '{"model":"mistralai/Mistral-Small-4","messages":[{"role":"user","content":"Bonjour"}]}'
Cas d'usage
Héberger soi-même un modèle open-weights pour des centaines d'utilisateurs, à débit élevé et coût GPU maîtrisé.
Anti-pattern
Utiliser vLLM pour un poste de développeur seul : Ollama ou llama.cpp suffisent et s'installent en une commande.
Termes liés
Fiche mise à jour le 2026-09-27