Ollama et modèles locaux
IA / LLM 🟡 MidDéfinition
Ollama exécute des modèles open-weights (Llama, Mistral, Qwen, DeepSeek…) sur une machine locale et expose un serveur HTTP sur le port 11434 : API native sous /api (chat, génération, embeddings) et API compatible OpenAI sous /v1. Aucune donnée ne quitte la machine ; la qualité dépend du modèle et de la quantification choisis.
Analogie
Faire tourner le moteur dans son garage plutôt que de louer une voiture à l'heure.
Exemple de code
# Installer, tirer un modèle, l'interroger
ollama pull qwen3.8:27b
ollama run qwen3.8:27b "Explique un index B-tree en 3 phrases"
# API native (port 11434)
curl http://localhost:11434/api/chat -d '{
"model": "qwen3.8:27b",
"messages": [{"role": "user", "content": "Bonjour"}],
"stream": false
}'
# Embeddings locaux
curl http://localhost:11434/api/embed -d '{"model":"nomic-embed-text","input":"texte à vectoriser"}'
Cas d'usage
Développement hors ligne, données sensibles, prototypage sans facture, tests d'intégration sans clé API.
Anti-pattern
Comparer un 8B quantifié local à un modèle frontière et conclure que « l'IA locale ne marche pas ».
Termes liés
Fiche mise à jour le 2026-09-27