Ollama et modèles locaux

IA / LLM 🟡 Mid

Définition

Ollama exécute des modèles open-weights (Llama, Mistral, Qwen, DeepSeek…) sur une machine locale et expose un serveur HTTP sur le port 11434 : API native sous /api (chat, génération, embeddings) et API compatible OpenAI sous /v1. Aucune donnée ne quitte la machine ; la qualité dépend du modèle et de la quantification choisis.

Analogie

Faire tourner le moteur dans son garage plutôt que de louer une voiture à l'heure.

Exemple de code

# Installer, tirer un modèle, l'interroger
ollama pull qwen3.8:27b
ollama run qwen3.8:27b "Explique un index B-tree en 3 phrases"

# API native (port 11434)
curl http://localhost:11434/api/chat -d '{
  "model": "qwen3.8:27b",
  "messages": [{"role": "user", "content": "Bonjour"}],
  "stream": false
}'

# Embeddings locaux
curl http://localhost:11434/api/embed -d '{"model":"nomic-embed-text","input":"texte à vectoriser"}'

Cas d'usage

Développement hors ligne, données sensibles, prototypage sans facture, tests d'intégration sans clé API.

Anti-pattern

Comparer un 8B quantifié local à un modèle frontière et conclure que « l'IA locale ne marche pas ».
#ia#open-weights#local#outils

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre