Token et tokenizer
IA / LLM 🟢 JuniorDéfinition
Un token est l'unité que manipule le modèle : un mot, un sous-mot, un caractère ou un octet. Le tokenizer découpe le texte (algorithmes BPE, WordPiece, Unigram) puis convertit chaque token en identifiant numérique. Pour Claude, un token vaut environ 3,5 caractères anglais ; la facturation, la fenêtre de contexte et les limites de débit se comptent en tokens.
Analogie
Découper une phrase en pièces de Lego de tailles variables : « anti » + « constitution » + « nel » + « lement ».
Exemple de code
// Compter les tokens AVANT d'envoyer (endpoint count_tokens Anthropic)
const res = await fetch('https://api.anthropic.com/v1/messages/count_tokens', {
method: 'POST',
headers: {
'x-api-key': process.env.ANTHROPIC_API_KEY!,
'anthropic-version': '2023-06-01',
'content-type': 'application/json',
},
body: JSON.stringify({
model: 'claude-sonnet-5',
messages: [{ role: 'user', content: longDocument }],
}),
});
const { input_tokens } = await res.json();
if (input_tokens > 900_000) throw new Error('Trop long pour 1M de contexte');
Cas d'usage
Estimer un coût, découper un document avant embedding, éviter un dépassement de contexte.
Anti-pattern
Approximer 1 token = 1 mot : le français et le code coûtent nettement plus de tokens que l'anglais.
Termes liés
Fiche mise à jour le 2026-09-27