LoRA (Low-Rank Adaptation)

IA / LLM 🔴 Senior

Définition

Technique de fine-tuning économe : on gèle les poids du modèle et on n'entraîne que deux petites matrices de rang faible ajoutées à certaines couches. Hu et al. (soumis le 17 juin 2021) rapportent jusqu'à 10 000 fois moins de paramètrès entraînables et 3 fois moins de mémoire GPU que le fine-tuning complet de GPT-3 175B, à qualité égale. QLoRA combine LoRA et quantification 4 bits.

Analogie

Coller un post-it de corrections sur chaque page d'un livre au lieu de le réimprimer.

Exemple de code

from peft import LoraConfig, get_peft_model
from transformers import AutoModelForCausalLM

base = AutoModelForCausalLM.from_pretrained('Qwen/Qwen3.8-27B')
config = LoraConfig(
    r=16,                     # rang des matrices A et B
    lora_alpha=32,
    target_modules=['q_proj', 'v_proj'],  # couches d'attention visées
    lora_dropout=0.05,
)
model = get_peft_model(base, config)
model.print_trainable_parameters()  # ~0,1 % des poids entraînables

Cas d'usage

Adapter un modèle open-weights à un domaine sur un seul GPU ; empiler plusieurs adaptateurs sur une même base.

Anti-pattern

Fine-tuner en plein sur un 70B pour une tâche de format : LoRA suffit et se déploie comme un fichier de quelques Mo.
#ia#entrainement#open-weights

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre