Benchmarks (SWE-bench, MMLU)
IA / LLM 🟡 MidDéfinition
Jeux d'évaluation publics. MMLU (Hendrycks et al., soumis le 7 septembre 2020) : questions à choix multiples sur 57 disciplines, aujourd'hui saturé. SWE-bench (Jimenez et al., soumis le 10 octobre 2023) : 2 294 issues GitHub réelles de 12 dépôts Python à résoudre par patch ; le meilleur modèle résolvait alors 1,96 %. Sur SWE-bench Verified, l'agrégateur llm-stats donnait en septembre 2026 Claude Fable 5 à 95,0 %. Les scores sont souvent auto-déclarés et dépendent du harnais.
Analogie
Le bac : utile pour comparer, mais personne n'embauche uniquement sur la mention.
Exemple de code
// Un benchmark maison vaut mieux qu'un classement public : même harnais pour tous
const models = ['claude-sonnet-5', 'claude-opus-5-5'];
const suite = await loadCases('./evals/support-tickets.jsonl'); // vos vrais cas
for (const model of models) {
let ok = 0, cost = 0;
for (const c of suite) {
const r = await runCase(model, c); // même prompt, même température
ok += Number(r.passed); cost += r.costUSD;
}
console.log(`${model}: ${(100 * ok / suite.length).toFixed(1)} % réussite, ${cost.toFixed(2)} $`);
}
Cas d'usage
Présélectionner des modèles avant vos propres evals ; comprendre une fiche de lancement.
Anti-pattern
Choisir un modèle sur 0,5 point de SWE-bench : l'écart est dans le bruit du harnais.
Termes liés
Fiche mise à jour le 2026-09-27