Alignement
IA / LLM 🟡 MidDéfinition
Ensemble des techniques qui font qu'un modèle se comporte selon les intentions humaines : utile, honnête, inoffensif (cadre HHH d'Anthropic). Après le pré-entraînement, on passe par fine-tuning supervisé, RLHF, ou Constitutional AI (Bai et al., soumis le 15 décembre 2022) où le modèle critique et révise ses propres réponses selon une liste de principes, puis apprend d'un retour d'IA (RLAIF).
Analogie
Un stagiaire brillant mais brut, qu'on forme au code de conduite de l'entreprise avant de le mettre devant les clients.
Exemple de code
{
"pipeline_alignement": [
{ "etape": "pre-entrainement", "objectif": "prédire le token suivant" },
{ "etape": "SFT", "objectif": "imiter des démonstrations humaines" },
{ "etape": "RLHF ou RLAIF", "objectif": "préférer les réponses jugées meilleures" },
{ "etape": "constitution", "objectif": "auto-critique selon des principes écrits" }
],
"cadre_HHH": ["helpful", "honest", "harmless"]
}
Cas d'usage
Comprendre pourquoi un modèle refuse certaines demandes et pourquoi les refus varient entre fournisseurs.
Anti-pattern
Croire qu'un modèle aligné est infaillible : l'alignement réduit les risques, il ne les supprime pas.
Termes liés
Fiche mise à jour le 2026-09-27