LoRA (Low-Rank Adaptation)
IA / LLM 🔴 SeniorDéfinition
Technique de fine-tuning économe : on gèle les poids du modèle et on n'entraîne que deux petites matrices de rang faible ajoutées à certaines couches. Hu et al. (soumis le 17 juin 2021) rapportent jusqu'à 10 000 fois moins de paramètrès entraînables et 3 fois moins de mémoire GPU que le fine-tuning complet de GPT-3 175B, à qualité égale. QLoRA combine LoRA et quantification 4 bits.
Analogie
Coller un post-it de corrections sur chaque page d'un livre au lieu de le réimprimer.
Exemple de code
from peft import LoraConfig, get_peft_model
from transformers import AutoModelForCausalLM
base = AutoModelForCausalLM.from_pretrained('Qwen/Qwen3.8-27B')
config = LoraConfig(
r=16, # rang des matrices A et B
lora_alpha=32,
target_modules=['q_proj', 'v_proj'], # couches d'attention visées
lora_dropout=0.05,
)
model = get_peft_model(base, config)
model.print_trainable_parameters() # ~0,1 % des poids entraînables
Cas d'usage
Adapter un modèle open-weights à un domaine sur un seul GPU ; empiler plusieurs adaptateurs sur une même base.
Anti-pattern
Fine-tuner en plein sur un 70B pour une tâche de format : LoRA suffit et se déploie comme un fichier de quelques Mo.
Termes liés
Fiche mise à jour le 2026-09-27