Inférence vs entraînement
IA / LLM 🟢 JuniorDéfinition
L'entraînement (pré-entraînement puis alignement) ajuste les poids sur des corpus massifs : il coûte des semaines de GPU et n'est fait que par le fournisseur. L'inférence est l'exécution du modèle figé pour répondre à une requête : c'est ce que paie l'utilisateur de l'API, au token. Un développeur produit n'interagit presque qu'avec l'inférence.
Analogie
Écrire le dictionnaire prend des années ; le consulter prend une seconde.
Exemple de code
// Tout ce qui suit est de l'INFÉRENCE : les poids ne bougent jamais.
const t0 = performance.now();
const msg = await client.messages.create({
model: 'claude-haiku-4-5',
max_tokens: 300,
messages: [{ role: 'user', content: prompt }],
});
console.log({
latenceMs: Math.round(performance.now() - t0),
entree: msg.usage.input_tokens, // facturés au tarif input
sortie: msg.usage.output_tokens, // facturés au tarif output
});
// « Apprendre » quelque chose au modèle = le mettre dans le prompt (RAG), pas l'entraîner.
Cas d'usage
Choisir entre RAG (inférence) et fine-tuning (entraînement) quand un client demande « que le modèle connaisse nos produits ».
Anti-pattern
Dire « le modèle a appris de ma conversation » : sans fine-tuning, rien n'est mémorisé entre deux requêtes.
Termes liés
Fiche mise à jour le 2026-09-27