Transformer
IA / LLM 🟡 MidDéfinition
Architecture de réseau de neurones introduite par Vaswani et al. dans « Attention Is All You Need » (soumis le 12 juin 2017). Elle abandonne la récurrence et les convolutions au profit de la seule attention, ce qui permet de paralléliser l'entraînement. Tous les LLM actuels en dérivent (décodeur seul pour GPT/Claude, encodeur pour BERT).
Analogie
Une salle de réunion où chaque mot regarde tous les autres en même temps, au lieu de se passer le message de proche en proche.
Exemple de code
# Squelette d'un bloc Transformer (décodeur) en pseudo-PyTorch
class Block(nn.Module):
def __init__(self, d, heads):
super().__init__()
self.attn = nn.MultiheadAttention(d, heads, batch_first=True)
self.ff = nn.Sequential(nn.Linear(d, 4*d), nn.GELU(), nn.Linear(4*d, d))
self.ln1, self.ln2 = nn.LayerNorm(d), nn.LayerNorm(d)
def forward(self, x, mask):
h = self.ln1(x)
x = x + self.attn(h, h, h, attn_mask=mask)[0] # attention causale
return x + self.ff(self.ln2(x)) # feed-forward
Cas d'usage
Question d'entretien classique : « pourquoi le Transformer a remplacé les RNN ? » (parallélisme, dépendances longues).
Anti-pattern
Confondre Transformer (architecture) et LLM (un modèle entraîné qui l'utilise).
Termes liés
Sources
Fiche mise à jour le 2026-09-27