Fenêtre de contexte
IA / LLM 🟢 JuniorDéfinition
Quantité maximale de tokens qu'un modèle peut prendre en compte dans une requête : prompt système, messages, définitions d'outils, images, plus la réponse et les tokens de réflexion. Claude Fable 5.1, Opus 5.5 et Sonnet 5 offrent 1 M de tokens (128 k en sortie), Haiku 4.5 200 k. Si l'entrée seule dépasse la fenêtre, l'API renvoie une erreur 400 « prompt is too long ».
Analogie
La mémoire de travail d'une personne : tout ce qu'elle garde à l'esprit pendant qu'elle répond, pas tout ce qu'elle a appris.
Exemple de code
// Lire la consommation réelle dans usage et surveiller la marge
const msg = await client.messages.create({
model: 'claude-opus-5-5',
max_tokens: 4096,
messages: history,
});
const { input_tokens, cache_read_input_tokens = 0,
cache_creation_input_tokens = 0, output_tokens } = msg.usage;
const used = input_tokens + cache_read_input_tokens
+ cache_creation_input_tokens + output_tokens;
if (used > 800_000) await compactHistory(history); // résumer avant le mur
if (msg.stop_reason === 'model_context_window_exceeded') retryShorter();
Cas d'usage
Dimensionner un agent long : quand résumer l'historique, quand basculer sur un sous-agent.
Anti-pattern
Remplir la fenêtre au maximum « puisqu'on a 1 M » : la précision baisse avec la taille (context rot).
Termes liés
Sources
Fiche mise à jour le 2026-09-27