Transformeurs et mécanisme d'attention
Un Transformer complet écrit à la main en PyTorch, construit bloc par bloc, puis mis en perspective avec BERT, GPT et T5. Le cours part du calcul d'attention le plus élémentaire et va jusqu'à un modèle entraîné à traduire « 3 mars 2026 » vers « 2026-03-03 » en visualisant l'attention pas à pas.
Durée du cours : 8 h
Ce que vous allez apprendre
- Comprendre pourquoi les réseaux récurrents ont plafonné et ce que l'attention corrige exactement
- Calculer une attention à la main sur trois jetons, projections requête, clé, valeur comprises
- Assembler l'attention multi-têtes, l'encodage de position et les blocs résiduels d'un encodeur
- Distinguer un encodeur (BERT), un décodeur (GPT) et un encodeur-décodeur (T5) selon la tâche
- Écrire de bout en bout un bloc Transformer en PyTorch et l'entraîner sur une tâche jouet visible
Prérequis
- Cours 11 (réseaux récurrents et LSTM) pour comprendre ce que l'attention remplace
- Un cadriciel de deep learning : cours 08 (TensorFlow et Keras) ou cours 09 (PyTorch)
- Python, NumPy, notions d'algèbre linéaire (produit scalaire, produit matriciel)
Modules du cours
- Les limites des réseaux récurrents que l'attention lève
- Requête, clé, valeur : l'attention pas à pas
- Attention multi-têtes
- Encodage de position, absolu puis rotatif
- Connexions résiduelles et normalisation par couche
- L'encodeur : BERT et les modèles de compréhension
- Le décodeur : GPT et la génération
- Encodeur-décodeur : T5 et la traduction
- Coût quadratique et attention efficace
- Implémentation d'un bloc Transformer complet
Évaluation et attestation
Le parcours se termine par un examen de 40 questions qui couvre les dix modules. En cas de réussite, une attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable sur la plateforme.
Les cours gratuits, eux, se concluent par un quiz de 5 questions avec un aperçu de l'attestation, sans certification.