Alignement

IA / LLM 🟡 Mid

Définition

Ensemble des techniques qui font qu'un modèle se comporte selon les intentions humaines : utile, honnête, inoffensif (cadre HHH d'Anthropic). Après le pré-entraînement, on passe par fine-tuning supervisé, RLHF, ou Constitutional AI (Bai et al., soumis le 15 décembre 2022) où le modèle critique et révise ses propres réponses selon une liste de principes, puis apprend d'un retour d'IA (RLAIF).

Analogie

Un stagiaire brillant mais brut, qu'on forme au code de conduite de l'entreprise avant de le mettre devant les clients.

Exemple de code

{
  "pipeline_alignement": [
    { "etape": "pre-entrainement", "objectif": "prédire le token suivant" },
    { "etape": "SFT", "objectif": "imiter des démonstrations humaines" },
    { "etape": "RLHF ou RLAIF", "objectif": "préférer les réponses jugées meilleures" },
    { "etape": "constitution", "objectif": "auto-critique selon des principes écrits" }
  ],
  "cadre_HHH": ["helpful", "honest", "harmless"]
}

Cas d'usage

Comprendre pourquoi un modèle refuse certaines demandes et pourquoi les refus varient entre fournisseurs.

Anti-pattern

Croire qu'un modèle aligné est infaillible : l'alignement réduit les risques, il ne les supprime pas.
#ia#fondamentaux#securite

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre