Modèles de raisonnement (thinking, effort)
IA / LLM 🟡 MidDéfinition
Modèles qui produisent des tokens de réflexion internes avant la réponse. Chez Anthropic, le « thinking » adaptatif se pilote par output_config.effort (low, médium, high, xhigh, max) ; chez OpenAI par reasoning.effort (none à max). Dans les deux cas ces tokens sont facturés comme tokens de sortie et occupent la fenêtre de contexte, même s'ils ne sont pas renvoyés.
Analogie
Laisser un consultant prendre des notes avant de parler : plus de notes, meilleure réponse, facture plus haute.
Exemple de code
// Anthropic : thinking adaptatif + niveau d'effort
const msg = await client.messages.create({
model: 'claude-opus-5-5',
max_tokens: 16000,
thinking: { type: 'adaptive', display: 'summarized' },
output_config: { effort: 'high' }, // low | medium | high | xhigh | max
messages: [{ role: 'user', content: 'Trouve la fuite mémoire dans ce code : ' + code }],
});
for (const block of msg.content) {
if (block.type === 'thinking') console.log('[réflexion]', block.thinking);
if (block.type === 'text') console.log(block.text);
}
Cas d'usage
Débogage complexe, planification d'agent, mathématiques ; baisser l'effort pour la classification.
Anti-pattern
Laisser l'effort au maximum pour un chatbot FAQ : latence et coût explosent sans gain.
Termes liés
Sources
Fiche mise à jour le 2026-09-27