📄️ Transformeurs et attention
Cours premium sur les Transformeurs : de l'attention Q-K-V à un Transformer PyTorch écrit à la main, avec BERT, GPT et T5 en contrepoint. Durée : 8 h, examen de 40 questions et attestation vérifiable.
📄️ 1. Limites des récurrents
Module 1 du cours premium Transformeurs : pourquoi les RNN et LSTM plafonnent sur les longues séquences, et comment l'attention de Bahdanau a préparé le terrain à l'architecture de 2017.
📄️ 2. Q, K, V pas à pas
Module 2 du cours premium Transformeurs : mécanique complète du produit scalaire mis à l'échelle, exemple numérique sur trois jetons, et première implémentation en PyTorch.
📄️ 3. Attention multi-têtes
Module 3 du cours premium Transformeurs : projections par tête, concaténation puis projection de sortie, ce que différentes têtes apprennent, et coût en paramètres.
📄️ 4. Encodage de position
Module 4 du cours premium Transformeurs : pourquoi l'attention ignore l'ordre des jetons, encodage sinusoïdal, positions apprises, RoPE et extrapolation de longueur.
📄️ 5. Résidus et LayerNorm
Module 5 du cours premium Transformeurs : pré-norm contre post-norm, LayerNorm contre BatchNorm, bloc feed-forward, et le composant ResidualBlock qui structure chaque couche.
📄️ 6. Encodeur BERT
Module 6 du cours premium Transformeurs : empilement d'encodeurs, préentraînement masqué, jeton de classification, affinage, et variantes RoBERTa, DistilBERT, CamemBERT.
📄️ 7. Décodeur GPT
Module 7 du cours premium Transformeurs : masque causal, prédiction du jeton suivant, décodage glouton, échantillonnage à température, top-k, top-p et cache clé-valeur.
📄️ 8. Encodeur-décodeur T5
Module 8 du cours premium Transformeurs : attention croisée, formulation texte à texte de T5, différence pratique entre les familles encodeur, décodeur et encodeur-décodeur.
📄️ 9. Coût et attention efficace
Module 9 du cours premium Transformeurs : mémoire en n au carré, FlashAttention, attention par fenêtre glissante, attention éparse, et compromis du contexte long.
📄️ 10. Bloc Transformer complet
Module 10 du cours premium Transformeurs : assemblage du fil rouge en PyTorch, entraînement sur la traduction de dates, visualisation des poids d'attention et tests unitaires de formes.
📄️ Récapitulation et examen
Récapitulation complète du cours premium Transformeurs : attention Q-K-V, multi-têtes, encodage de position, résidus, encodeur, décodeur, encodeur-décodeur et coût quadratique, puis l'examen de 40 questions.