RLHF (apprentissage par renforcement à partir de retours humains)
IA / LLM 🟡 MidDéfinition
Méthode d'alignement en trois temps : fine-tuning supervisé sur des démonstrations, entraînement d'un modèle de récompense sur des classements humains de réponses, puis optimisation du modèle par renforcement contre cette récompense. Le papier InstructGPT (Ouyang et al., soumis le 4 mars 2022) montre qu'un modèle de 1,3 milliard de paramètrès ainsi entraîné est préféré à GPT-3 175 milliards.
Analogie
Un cuisinier qui ajuste ses plats d'après les notes des clients plutôt que d'après le livre de recettes.
Exemple de code
# Schéma simplifié d'une boucle RLHF (pseudo-code)
sft = finetune(base_model, demonstrations) # 1. SFT
reward_model = train_reward(sft, human_rankings) # 2. modèle de récompense
for prompt in prompts: # 3. RL (PPO ou variante)
response = sft.generate(prompt)
r = reward_model.score(prompt, response)
kl = kl_divergence(sft, base_model, prompt) # ne pas trop s'éloigner
sft.update(reward=r - beta * kl)
Cas d'usage
Question d'entretien : différence entre SFT, RLHF et DPO (qui supprime le modèle de récompense explicite).
Anti-pattern
Confondre RLHF (entraînement) et prompting : on ne « fait pas de RLHF » en écrivant un system prompt.
Termes liés
Fiche mise à jour le 2026-09-27