Benchmarks (SWE-bench, MMLU)

IA / LLM 🟡 Mid

Définition

Jeux d'évaluation publics. MMLU (Hendrycks et al., soumis le 7 septembre 2020) : questions à choix multiples sur 57 disciplines, aujourd'hui saturé. SWE-bench (Jimenez et al., soumis le 10 octobre 2023) : 2 294 issues GitHub réelles de 12 dépôts Python à résoudre par patch ; le meilleur modèle résolvait alors 1,96 %. Sur SWE-bench Verified, l'agrégateur llm-stats donnait en septembre 2026 Claude Fable 5 à 95,0 %. Les scores sont souvent auto-déclarés et dépendent du harnais.

Analogie

Le bac : utile pour comparer, mais personne n'embauche uniquement sur la mention.

Exemple de code

// Un benchmark maison vaut mieux qu'un classement public : même harnais pour tous
const models = ['claude-sonnet-5', 'claude-opus-5-5'];
const suite = await loadCases('./evals/support-tickets.jsonl');   // vos vrais cas

for (const model of models) {
  let ok = 0, cost = 0;
  for (const c of suite) {
    const r = await runCase(model, c);       // même prompt, même température
    ok += Number(r.passed); cost += r.costUSD;
  }
  console.log(`${model}: ${(100 * ok / suite.length).toFixed(1)} % réussite, ${cost.toFixed(2)} $`);
}

Cas d'usage

Présélectionner des modèles avant vos propres evals ; comprendre une fiche de lancement.

Anti-pattern

Choisir un modèle sur 0,5 point de SWE-bench : l'écart est dans le bruit du harnais.
#ia#modeles#qualite#interview

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre