Multimodal (vision, documents)
IA / LLM 🟡 MidDéfinition
Capacité d'un modèle à recevoir plusieurs types d'entrées (texte, images, PDF, audio selon le fournisseur) dans une même requête. L'API Claude accepte des blocs image en base64, par URL ou via un file_id (JPEG, PNG, GIF, WebP, jusqu'à 8000×8000 px) ; l'image est découpée en patchs de 28×28 pixels, chacun comptant pour un token visuel.
Analogie
Un collègué à qui l'on peut montrer la capture d'écran au lieu de décrire le bug par téléphone.
Exemple de code
import { readFileSync } from 'node:fs';
const data = readFileSync('capture-bug.png').toString('base64');
const msg = await client.messages.create({
model: 'claude-sonnet-5', max_tokens: 600,
messages: [{
role: 'user',
content: [
{ type: 'image', source: { type: 'base64', media_type: 'image/png', data } },
{ type: 'text', text: 'Quel message d\'erreur est affiché et quelle est sa cause probable ?' },
],
}],
});
// Coût ≈ ⌈largeur/28⌉ × ⌈hauteur/28⌉ tokens visuels (1000×1000 ≈ 1296 tokens)
Cas d'usage
Lecture de factures, analyse de captures d'écran en support, tests visuels d'interface.
Anti-pattern
Envoyer des images 4K en base64 à chaque tour d'une longue conversation : redimensionner ou passer par la Files API.
Termes liés
Fiche mise à jour le 2026-09-27