Transformeurs et attention
L'architecture Transformer et le mécanisme d'attention, fondement des modèles de langage actuels.
Durée du cours : 8h
Ce que vous allez apprendre
- Calculer une attention à partir des requêtes, clés et valeurs
- Expliquer ce que l'attention multi-têtes apporte de plus
- Décrire le rôle de l'encodage de position
- Distinguer architectures encodeur, décodeur et encodeur-décodeur
- Mesurer le coût quadratique de l'attention et ses contournements
Prérequis
- Fondamentaux du deep learning
- Notions de traitement du langage
Modules du cours
- Les limites des réseaux récurrents que l'attention lève
- Requête, clé, valeur : l'attention pas à pas
- Attention multi-têtes
- Encodage de position, absolu puis rotatif
- Connexions résiduelles et normalisation par couche
- L'encodeur : BERT et les modèles de compréhension
- Le décodeur : GPT et la génération
- Encodeur-décodeur : T5 et la traduction
- Coût quadratique et attention efficace
- Implémentation d'un bloc Transformer complet
Évaluation et attestation
Le parcours se termine par un examen de 40 questions qui couvre tous les modules. En cas de réussite, une attestation d'achèvement est délivrée ; son numéro est vérifiable sur la plateforme.
Les cours gratuits, eux, se concluent par un quiz de 5 questions avec un aperçu de l'attestation, sans certification.