RLHF (apprentissage par renforcement à partir de retours humains)

IA / LLM 🟡 Mid

Définition

Méthode d'alignement en trois temps : fine-tuning supervisé sur des démonstrations, entraînement d'un modèle de récompense sur des classements humains de réponses, puis optimisation du modèle par renforcement contre cette récompense. Le papier InstructGPT (Ouyang et al., soumis le 4 mars 2022) montre qu'un modèle de 1,3 milliard de paramètrès ainsi entraîné est préféré à GPT-3 175 milliards.

Analogie

Un cuisinier qui ajuste ses plats d'après les notes des clients plutôt que d'après le livre de recettes.

Exemple de code

# Schéma simplifié d'une boucle RLHF (pseudo-code)
sft = finetune(base_model, demonstrations)        # 1. SFT
reward_model = train_reward(sft, human_rankings)  # 2. modèle de récompense
for prompt in prompts:                            # 3. RL (PPO ou variante)
    response = sft.generate(prompt)
    r = reward_model.score(prompt, response)
    kl = kl_divergence(sft, base_model, prompt)   # ne pas trop s'éloigner
    sft.update(reward=r - beta * kl)

Cas d'usage

Question d'entretien : différence entre SFT, RLHF et DPO (qui supprime le modèle de récompense explicite).

Anti-pattern

Confondre RLHF (entraînement) et prompting : on ne « fait pas de RLHF » en écrivant un system prompt.
#ia#fondamentaux#entrainement

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre