Modèles de raisonnement (thinking, effort)

IA / LLM 🟡 Mid

Définition

Modèles qui produisent des tokens de réflexion internes avant la réponse. Chez Anthropic, le « thinking » adaptatif se pilote par output_config.effort (low, médium, high, xhigh, max) ; chez OpenAI par reasoning.effort (none à max). Dans les deux cas ces tokens sont facturés comme tokens de sortie et occupent la fenêtre de contexte, même s'ils ne sont pas renvoyés.

Analogie

Laisser un consultant prendre des notes avant de parler : plus de notes, meilleure réponse, facture plus haute.

Exemple de code

// Anthropic : thinking adaptatif + niveau d'effort
const msg = await client.messages.create({
  model: 'claude-opus-5-5',
  max_tokens: 16000,
  thinking: { type: 'adaptive', display: 'summarized' },
  output_config: { effort: 'high' },     // low | medium | high | xhigh | max
  messages: [{ role: 'user', content: 'Trouve la fuite mémoire dans ce code : ' + code }],
});
for (const block of msg.content) {
  if (block.type === 'thinking') console.log('[réflexion]', block.thinking);
  if (block.type === 'text') console.log(block.text);
}

Cas d'usage

Débogage complexe, planification d'agent, mathématiques ; baisser l'effort pour la classification.

Anti-pattern

Laisser l'effort au maximum pour un chatbot FAQ : latence et coût explosent sans gain.
#ia#raisonnement#api#interview

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre