Inférence vs entraînement

IA / LLM 🟢 Junior

Définition

L'entraînement (pré-entraînement puis alignement) ajuste les poids sur des corpus massifs : il coûte des semaines de GPU et n'est fait que par le fournisseur. L'inférence est l'exécution du modèle figé pour répondre à une requête : c'est ce que paie l'utilisateur de l'API, au token. Un développeur produit n'interagit presque qu'avec l'inférence.

Analogie

Écrire le dictionnaire prend des années ; le consulter prend une seconde.

Exemple de code

// Tout ce qui suit est de l'INFÉRENCE : les poids ne bougent jamais.
const t0 = performance.now();
const msg = await client.messages.create({
  model: 'claude-haiku-4-5',
  max_tokens: 300,
  messages: [{ role: 'user', content: prompt }],
});
console.log({
  latenceMs: Math.round(performance.now() - t0),
  entree: msg.usage.input_tokens,     // facturés au tarif input
  sortie: msg.usage.output_tokens,    // facturés au tarif output
});
// « Apprendre » quelque chose au modèle = le mettre dans le prompt (RAG), pas l'entraîner.

Cas d'usage

Choisir entre RAG (inférence) et fine-tuning (entraînement) quand un client demande « que le modèle connaisse nos produits ».

Anti-pattern

Dire « le modèle a appris de ma conversation » : sans fine-tuning, rien n'est mémorisé entre deux requêtes.
#ia#fondamentaux#interview

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre