Multimodal (vision, documents)

IA / LLM 🟡 Mid

Définition

Capacité d'un modèle à recevoir plusieurs types d'entrées (texte, images, PDF, audio selon le fournisseur) dans une même requête. L'API Claude accepte des blocs image en base64, par URL ou via un file_id (JPEG, PNG, GIF, WebP, jusqu'à 8000×8000 px) ; l'image est découpée en patchs de 28×28 pixels, chacun comptant pour un token visuel.

Analogie

Un collègué à qui l'on peut montrer la capture d'écran au lieu de décrire le bug par téléphone.

Exemple de code

import { readFileSync } from 'node:fs';
const data = readFileSync('capture-bug.png').toString('base64');

const msg = await client.messages.create({
  model: 'claude-sonnet-5', max_tokens: 600,
  messages: [{
    role: 'user',
    content: [
      { type: 'image', source: { type: 'base64', media_type: 'image/png', data } },
      { type: 'text', text: 'Quel message d\'erreur est affiché et quelle est sa cause probable ?' },
    ],
  }],
});
// Coût ≈ ⌈largeur/28⌉ × ⌈hauteur/28⌉ tokens visuels (1000×1000 ≈ 1296 tokens)

Cas d'usage

Lecture de factures, analyse de captures d'écran en support, tests visuels d'interface.

Anti-pattern

Envoyer des images 4K en base64 à chaque tour d'une longue conversation : redimensionner ou passer par la Files API.
#ia#multimodal#api

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre