Coût par token

IA / LLM 🟢 Junior

Définition

Les API se facturent par million de tokens (MTok) avec un tarif d'entrée et un tarif de sortie distincts. Au 27 septembre 2026 chez Anthropic : Claude Fable 5.1 10 $/50 $, Opus 5.5 4 $/20 $, Sonnet 5 2 $/10 $, Haiku 4.5 1 $/5 $. Le Batch API divise par deux et la lecture de cache coûte 10 % du prix d'entrée (2,5 % sur Fable 5.1). Les tokens de réflexion sont facturés en sortie.

Analogie

Une facture téléphonique : un tarif pour parler, un autre pour écoûter, et des réductions hors pointe.

Exemple de code

// Estimation de coût à partir de usage (prix en $ / MTok, Sonnet 5)
const PRICE = { input: 2, output: 10, cacheRead: 0.2, cacheWrite5m: 2.5 };

function costUSD(u: Anthropic.Usage) {
  const M = 1_000_000;
  return (u.input_tokens * PRICE.input
        + u.output_tokens * PRICE.output
        + (u.cache_read_input_tokens ?? 0) * PRICE.cacheRead
        + (u.cache_creation_input_tokens ?? 0) * PRICE.cacheWrite5m) / M;
}
console.log(`~${costUSD(msg.usage).toFixed(5)} $`);

Cas d'usage

Chiffrer une fonctionnalité IA avant de la vendre ; choisir le modèle par tâche (Haiku pour trier, Opus pour raisonner).

Anti-pattern

Ne compter que les tokens de sortie : un RAG qui renvoie 50 k tokens de contexte par question coûte surtout en entrée.
#ia#cout#api#interview

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre