Aller au contenu principal

Récapitulation et examen final

Dix modules pour passer d'un produit scalaire entre trois vecteurs à un Transformer complet qui traduit « 3 mars 2026 » vers « 2026-03-03 » sous nos yeux. Voici le cours condensé, puis les fils qui le traversent.

Le cours d'un coup d'œil

ModuleL'essentiel à retenir
1. Limites des récurrentsLa séquentialité tue le parallélisme ; le goulot du vecteur de contexte plafonne les longues séquences
2. Q, K, V pas à pasTrois projections apprises, produit scalaire mis à l'échelle par dk\sqrt{d_k}, softmax ligne par ligne
3. Attention multi-têtesCoût 4d24 d^2 paramètres indépendant du nombre de têtes ; chaque tête se spécialise
4. Encodage de positionL'attention est permutation-équivariante ; sinusoïdal, appris, ou rotatif (RoPE)
5. Résidus et LayerNormPré-norm depuis 2019 ; LayerNorm et non BatchNorm ; feed-forward de dimension 4d4d
6. Encodeur BERTAttention bidirectionnelle, préentraînement masqué à 15 %, jeton [CLS]
7. Décodeur GPTMasque causal, perte sur presque tous les jetons, cache KV pour l'inférence
8. Encodeur-décodeur T5Attention croisée ; tout est texte-à-texte ; mT5 pour le français
9. Coût et attention efficaceO(L2)O(L^2) en mémoire ; FlashAttention exact, fenêtre et éparse approximatifs
10. Bloc Transformer complet200 lignes PyTorch, décalage cible obligatoire, tests unitaires de forme

Les fils qui traversent le cours

L'attention règle un problème et en crée un autre. Elle supprime la séquentialité et le goulot du vecteur de contexte, ce qui rend l'entraînement parallèle et les dépendances longues accessibles en un saut. En échange, elle introduit un coût quadratique en LL, en calcul et surtout en mémoire. Toute l'histoire des cinq dernières années — FlashAttention, fenêtres, GQA, RoPE avec interpolation — consiste à repousser ce coût tout en gardant l'idée centrale intacte. C'est ce basculement du goulot d'un endroit à un autre qui explique pourquoi chaque nouveau modèle publié met en avant la même métrique : la longueur de contexte utile.

L'architecture se choisit sur la nature de la tâche, pas sur la mode. Un encodeur (BERT) pour classer, un décodeur (GPT) pour générer librement, un encodeur-décodeur (T5) pour transformer un texte source en un texte cible différent. Les très grands décodeurs absorbent aujourd'hui des tâches historiquement encodeur-décodeur, mais pour un modèle de taille modeste, choisir la bonne famille économise dix fois les paramètres. Sur notre fil rouge, prendre un encodeur-décodeur plutôt qu'un décodeur pur rend l'attention croisée visible, et c'est précisément cette visibilité qui rend le cours pédagogique.

Les détails qui font la différence sont souvent invisibles dans une formule. La division par dk\sqrt{d_k}, le softmax ligne par ligne, le masque causal avec -inf avant softmax, la pré-norm et non la post-norm, le décalage d'un jeton entre entrée et sortie cible, l'addition de l'encodage de position et non sa concaténation : ces choix ne se lisent nulle part dans l'équation compacte de l'attention, mais chacun d'eux peut faire échouer un modèle en silence. La perte descend, tout semble normal, et pourtant la génération produit n'importe quoi. C'est la principale source de bogues du domaine, et c'est pourquoi les tests unitaires de forme et l'inspection des cartes d'attention sont deux réflexes à acquérir.

L'échelle a fait le domaine, mais elle repose sur des idées simples. BERT, GPT, T5 et leurs successeurs multiplient les paramètres, les données, les GPU. Sous le capot, ce sont encore les mêmes briques : trois projections, un produit scalaire mis à l'échelle, un softmax, une moyenne pondérée, un résidu, une norme. Comprendre ces briques ne suffit pas à entraîner GPT-5, mais cela suffit à lire les articles récents, à choisir le bon modèle pour un projet et à diagnostiquer ce qui ne marche pas.

L'examen final

L'examen comporte 40 questions couvrant les dix modules : calcul d'attention à la main sur trois jetons, dimensionnement des têtes et coût en paramètres, choix entre encodage sinusoïdal, appris ou RoPE selon la longueur, agencement pré-norm ou post-norm, distinction bidirectionnel-BERT contre causal-GPT, choix de famille selon la tâche (encodeur, décodeur, encodeur-décodeur), masque causal oublié, estimation de mémoire selon la longueur, et lecture d'une carte d'attention croisée.

Plusieurs questions présentent des situations à diagnostiquer : une perte qui descend mais des générations incohérentes (masque causal oublié), un modèle qui plafonne à une longueur donnée (positions apprises), une extension de contexte qui se dégrade brutalement (RoPE sans interpolation), un décodeur qui recopie l'entrée (décalage cible oublié), une matrice d'attention qui somme à un sur les colonnes au lieu des lignes (softmax dans la mauvaise dimension). C'est le jugement qui est évalué, pas la mémorisation des signatures d'API.

En cas de réussite, votre attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.

Avant de commencer

Reprenez le tableau ci-dessus et, pour chaque ligne, demandez-vous « quel symptôme verrais-je si je me trompais ici ? ». Si vous savez expliquer pourquoi le softmax doit s'appliquer ligne par ligne, pourquoi le masque causal met -\infty et non zéro, pourquoi RoPE permet l'extension de contexte alors que les positions apprises n'y parviennent pas, et pourquoi la pré-norm a remplacé la post-norm sur les grands modèles, vous êtes prêt. Bonne chance !

Examen final

Prêt à valider ce cours ?

40 questions tirées au hasard dans la banque du cours · seuil de réussite 70 % · certificat PDF vérifiable délivré immédiatement en cas de réussite.

Commencer l'examen

Connexion à votre compte InSkillML et abonnement actif requis. Vous pouvez aussi lancer l'examen depuis Mes cours.