Récapitulation et examen final
Dix modules pour passer d'un produit scalaire entre trois vecteurs à un Transformer complet qui traduit « 3 mars 2026 » vers « 2026-03-03 » sous nos yeux. Voici le cours condensé, puis les fils qui le traversent.
Le cours d'un coup d'œil
| Module | L'essentiel à retenir |
|---|---|
| 1. Limites des récurrents | La séquentialité tue le parallélisme ; le goulot du vecteur de contexte plafonne les longues séquences |
| 2. Q, K, V pas à pas | Trois projections apprises, produit scalaire mis à l'échelle par , softmax ligne par ligne |
| 3. Attention multi-têtes | Coût paramètres indépendant du nombre de têtes ; chaque tête se spécialise |
| 4. Encodage de position | L'attention est permutation-équivariante ; sinusoïdal, appris, ou rotatif (RoPE) |
| 5. Résidus et LayerNorm | Pré-norm depuis 2019 ; LayerNorm et non BatchNorm ; feed-forward de dimension |
| 6. Encodeur BERT | Attention bidirectionnelle, préentraînement masqué à 15 %, jeton [CLS] |
| 7. Décodeur GPT | Masque causal, perte sur presque tous les jetons, cache KV pour l'inférence |
| 8. Encodeur-décodeur T5 | Attention croisée ; tout est texte-à-texte ; mT5 pour le français |
| 9. Coût et attention efficace | en mémoire ; FlashAttention exact, fenêtre et éparse approximatifs |
| 10. Bloc Transformer complet | 200 lignes PyTorch, décalage cible obligatoire, tests unitaires de forme |
Les fils qui traversent le cours
L'attention règle un problème et en crée un autre. Elle supprime la séquentialité et le goulot du vecteur de contexte, ce qui rend l'entraînement parallèle et les dépendances longues accessibles en un saut. En échange, elle introduit un coût quadratique en , en calcul et surtout en mémoire. Toute l'histoire des cinq dernières années — FlashAttention, fenêtres, GQA, RoPE avec interpolation — consiste à repousser ce coût tout en gardant l'idée centrale intacte. C'est ce basculement du goulot d'un endroit à un autre qui explique pourquoi chaque nouveau modèle publié met en avant la même métrique : la longueur de contexte utile.
L'architecture se choisit sur la nature de la tâche, pas sur la mode. Un encodeur (BERT) pour classer, un décodeur (GPT) pour générer librement, un encodeur-décodeur (T5) pour transformer un texte source en un texte cible différent. Les très grands décodeurs absorbent aujourd'hui des tâches historiquement encodeur-décodeur, mais pour un modèle de taille modeste, choisir la bonne famille économise dix fois les paramètres. Sur notre fil rouge, prendre un encodeur-décodeur plutôt qu'un décodeur pur rend l'attention croisée visible, et c'est précisément cette visibilité qui rend le cours pédagogique.
Les détails qui font la différence sont souvent invisibles dans une formule. La division par , le softmax ligne par ligne, le masque causal avec -inf avant softmax, la pré-norm et non la post-norm, le décalage d'un jeton entre entrée et sortie cible, l'addition de l'encodage de position et non sa concaténation : ces choix ne se lisent nulle part dans l'équation compacte de l'attention, mais chacun d'eux peut faire échouer un modèle en silence. La perte descend, tout semble normal, et pourtant la génération produit n'importe quoi. C'est la principale source de bogues du domaine, et c'est pourquoi les tests unitaires de forme et l'inspection des cartes d'attention sont deux réflexes à acquérir.
L'échelle a fait le domaine, mais elle repose sur des idées simples. BERT, GPT, T5 et leurs successeurs multiplient les paramètres, les données, les GPU. Sous le capot, ce sont encore les mêmes briques : trois projections, un produit scalaire mis à l'échelle, un softmax, une moyenne pondérée, un résidu, une norme. Comprendre ces briques ne suffit pas à entraîner GPT-5, mais cela suffit à lire les articles récents, à choisir le bon modèle pour un projet et à diagnostiquer ce qui ne marche pas.
L'examen final
L'examen comporte 40 questions couvrant les dix modules : calcul d'attention à la main sur trois jetons, dimensionnement des têtes et coût en paramètres, choix entre encodage sinusoïdal, appris ou RoPE selon la longueur, agencement pré-norm ou post-norm, distinction bidirectionnel-BERT contre causal-GPT, choix de famille selon la tâche (encodeur, décodeur, encodeur-décodeur), masque causal oublié, estimation de mémoire selon la longueur, et lecture d'une carte d'attention croisée.
Plusieurs questions présentent des situations à diagnostiquer : une perte qui descend mais des générations incohérentes (masque causal oublié), un modèle qui plafonne à une longueur donnée (positions apprises), une extension de contexte qui se dégrade brutalement (RoPE sans interpolation), un décodeur qui recopie l'entrée (décalage cible oublié), une matrice d'attention qui somme à un sur les colonnes au lieu des lignes (softmax dans la mauvaise dimension). C'est le jugement qui est évalué, pas la mémorisation des signatures d'API.
En cas de réussite, votre attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.
Reprenez le tableau ci-dessus et, pour chaque ligne, demandez-vous « quel symptôme verrais-je si je me trompais ici ? ». Si vous savez expliquer pourquoi le softmax doit s'appliquer ligne par ligne, pourquoi le masque causal met et non zéro, pourquoi RoPE permet l'extension de contexte alors que les positions apprises n'y parviennent pas, et pourquoi la pré-norm a remplacé la post-norm sur les grands modèles, vous êtes prêt. Bonne chance !
Examen final
Prêt à valider ce cours ?
40 questions tirées au hasard dans la banque du cours · seuil de réussite 70 % · certificat PDF vérifiable délivré immédiatement en cas de réussite.
Commencer l'examenConnexion à votre compte InSkillML et abonnement actif requis. Vous pouvez aussi lancer l'examen depuis Mes cours.