Fenêtre de contexte

IA / LLM 🟢 Junior

Définition

Quantité maximale de tokens qu'un modèle peut prendre en compte dans une requête : prompt système, messages, définitions d'outils, images, plus la réponse et les tokens de réflexion. Claude Fable 5.1, Opus 5.5 et Sonnet 5 offrent 1 M de tokens (128 k en sortie), Haiku 4.5 200 k. Si l'entrée seule dépasse la fenêtre, l'API renvoie une erreur 400 « prompt is too long ».

Analogie

La mémoire de travail d'une personne : tout ce qu'elle garde à l'esprit pendant qu'elle répond, pas tout ce qu'elle a appris.

Exemple de code

// Lire la consommation réelle dans usage et surveiller la marge
const msg = await client.messages.create({
  model: 'claude-opus-5-5',
  max_tokens: 4096,
  messages: history,
});
const { input_tokens, cache_read_input_tokens = 0,
        cache_creation_input_tokens = 0, output_tokens } = msg.usage;
const used = input_tokens + cache_read_input_tokens
           + cache_creation_input_tokens + output_tokens;
if (used > 800_000) await compactHistory(history); // résumer avant le mur
if (msg.stop_reason === 'model_context_window_exceeded') retryShorter();

Cas d'usage

Dimensionner un agent long : quand résumer l'historique, quand basculer sur un sous-agent.

Anti-pattern

Remplir la fenêtre au maximum « puisqu'on a 1 M » : la précision baisse avec la taille (context rot).
#ia#fondamentaux#tokens#interview

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre