Transformer

IA / LLM 🟡 Mid

Définition

Architecture de réseau de neurones introduite par Vaswani et al. dans « Attention Is All You Need » (soumis le 12 juin 2017). Elle abandonne la récurrence et les convolutions au profit de la seule attention, ce qui permet de paralléliser l'entraînement. Tous les LLM actuels en dérivent (décodeur seul pour GPT/Claude, encodeur pour BERT).

Analogie

Une salle de réunion où chaque mot regarde tous les autres en même temps, au lieu de se passer le message de proche en proche.

Exemple de code

# Squelette d'un bloc Transformer (décodeur) en pseudo-PyTorch
class Block(nn.Module):
    def __init__(self, d, heads):
        super().__init__()
        self.attn = nn.MultiheadAttention(d, heads, batch_first=True)
        self.ff = nn.Sequential(nn.Linear(d, 4*d), nn.GELU(), nn.Linear(4*d, d))
        self.ln1, self.ln2 = nn.LayerNorm(d), nn.LayerNorm(d)
    def forward(self, x, mask):
        h = self.ln1(x)
        x = x + self.attn(h, h, h, attn_mask=mask)[0]  # attention causale
        return x + self.ff(self.ln2(x))                # feed-forward

Cas d'usage

Question d'entretien classique : « pourquoi le Transformer a remplacé les RNN ? » (parallélisme, dépendances longues).

Anti-pattern

Confondre Transformer (architecture) et LLM (un modèle entraîné qui l'utilise).
#ia#fondamentaux#architecture#interview

Fiche mise à jour le 2026-09-27

← → au clavier pour passer d'une fiche à l'autre