Evals et LLM-as-a-judge

IA / LLM 🟡 Mid

Définition

Les evals sont des jeux de tests qui mesurent une application IA sur des critères SMART : exactitude, format, ton, latence, coût. Notation par code (égalité exacte, regex, similarité cosinus), par humains, ou par un LLM juge (échelle de Likert, classification binaire). Zheng et al. (soumis le 9 juin 2023) montrent qu'un juge LLM fort atteint plus de 80 % d'accord avec les préférences humaines, du niveau de l'accord entre humains.

Analogie

Les tests unitaires du prompt : on ne change pas une ligne sans relancer la suite.

Exemple de code

const cases = [
  { input: 'Mon site est en 502', expect: { categorie: 'incident' } },
  { input: 'Facture en double', expect: { categorie: 'facturation' } },
];
let pass = 0;
for (const c of cases) {
  const out = await classify(c.input);                 // fonction testée
  const exact = out.categorie === c.expect.categorie;  // notation par code
  const judge = await client.messages.create({           // notation par LLM
    model: 'claude-opus-5-5', max_tokens: 5,
    messages: [{ role: 'user', content: `Note de 1 à 5 la politesse de :\n<r>${out.reply}</r>\nRéponds par le chiffre seul.` }],
  });
  if (exact && Number(judge.content[0].text) >= 4) pass++;
}
console.log(`${pass}/${cases.length} réussis`);

Cas d'usage

Comparer deux prompts ou deux modèles avant mise en production ; détecter une régression après changement de modèle.

Anti-pattern

Juger avec le même modèle et le même prompt que celui évalué : biais d'auto-complaisance.
#ia#qualite#tests#interview

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre