Evals et LLM-as-a-judge
IA / LLM 🟡 MidDéfinition
Les evals sont des jeux de tests qui mesurent une application IA sur des critères SMART : exactitude, format, ton, latence, coût. Notation par code (égalité exacte, regex, similarité cosinus), par humains, ou par un LLM juge (échelle de Likert, classification binaire). Zheng et al. (soumis le 9 juin 2023) montrent qu'un juge LLM fort atteint plus de 80 % d'accord avec les préférences humaines, du niveau de l'accord entre humains.
Analogie
Les tests unitaires du prompt : on ne change pas une ligne sans relancer la suite.
Exemple de code
const cases = [
{ input: 'Mon site est en 502', expect: { categorie: 'incident' } },
{ input: 'Facture en double', expect: { categorie: 'facturation' } },
];
let pass = 0;
for (const c of cases) {
const out = await classify(c.input); // fonction testée
const exact = out.categorie === c.expect.categorie; // notation par code
const judge = await client.messages.create({ // notation par LLM
model: 'claude-opus-5-5', max_tokens: 5,
messages: [{ role: 'user', content: `Note de 1 à 5 la politesse de :\n<r>${out.reply}</r>\nRéponds par le chiffre seul.` }],
});
if (exact && Number(judge.content[0].text) >= 4) pass++;
}
console.log(`${pass}/${cases.length} réussis`);
Cas d'usage
Comparer deux prompts ou deux modèles avant mise en production ; détecter une régression après changement de modèle.
Anti-pattern
Juger avec le même modèle et le même prompt que celui évalué : biais d'auto-complaisance.
Termes liés
Fiche mise à jour le 2026-09-27