Token et tokenizer

IA / LLM 🟢 Junior

Définition

Un token est l'unité que manipule le modèle : un mot, un sous-mot, un caractère ou un octet. Le tokenizer découpe le texte (algorithmes BPE, WordPiece, Unigram) puis convertit chaque token en identifiant numérique. Pour Claude, un token vaut environ 3,5 caractères anglais ; la facturation, la fenêtre de contexte et les limites de débit se comptent en tokens.

Analogie

Découper une phrase en pièces de Lego de tailles variables : « anti » + « constitution » + « nel » + « lement ».

Exemple de code

// Compter les tokens AVANT d'envoyer (endpoint count_tokens Anthropic)
const res = await fetch('https://api.anthropic.com/v1/messages/count_tokens', {
  method: 'POST',
  headers: {
    'x-api-key': process.env.ANTHROPIC_API_KEY!,
    'anthropic-version': '2023-06-01',
    'content-type': 'application/json',
  },
  body: JSON.stringify({
    model: 'claude-sonnet-5',
    messages: [{ role: 'user', content: longDocument }],
  }),
});
const { input_tokens } = await res.json();
if (input_tokens > 900_000) throw new Error('Trop long pour 1M de contexte');

Cas d'usage

Estimer un coût, découper un document avant embedding, éviter un dépassement de contexte.

Anti-pattern

Approximer 1 token = 1 mot : le français et le code coûtent nettement plus de tokens que l'anglais.
#ia#fondamentaux#tokens#interview

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre