Coût par token
IA / LLM 🟢 JuniorDéfinition
Les API se facturent par million de tokens (MTok) avec un tarif d'entrée et un tarif de sortie distincts. Au 27 septembre 2026 chez Anthropic : Claude Fable 5.1 10 $/50 $, Opus 5.5 4 $/20 $, Sonnet 5 2 $/10 $, Haiku 4.5 1 $/5 $. Le Batch API divise par deux et la lecture de cache coûte 10 % du prix d'entrée (2,5 % sur Fable 5.1). Les tokens de réflexion sont facturés en sortie.
Analogie
Une facture téléphonique : un tarif pour parler, un autre pour écoûter, et des réductions hors pointe.
Exemple de code
// Estimation de coût à partir de usage (prix en $ / MTok, Sonnet 5)
const PRICE = { input: 2, output: 10, cacheRead: 0.2, cacheWrite5m: 2.5 };
function costUSD(u: Anthropic.Usage) {
const M = 1_000_000;
return (u.input_tokens * PRICE.input
+ u.output_tokens * PRICE.output
+ (u.cache_read_input_tokens ?? 0) * PRICE.cacheRead
+ (u.cache_creation_input_tokens ?? 0) * PRICE.cacheWrite5m) / M;
}
console.log(`~${costUSD(msg.usage).toFixed(5)} $`);
Cas d'usage
Chiffrer une fonctionnalité IA avant de la vendre ; choisir le modèle par tâche (Haiku pour trier, Opus pour raisonner).
Anti-pattern
Ne compter que les tokens de sortie : un RAG qui renvoie 50 k tokens de contexte par question coûte surtout en entrée.
Termes liés
Fiche mise à jour le 2026-09-27