Aller au contenu principal

Transformeurs et attention

L'architecture Transformer et le mécanisme d'attention, fondement des modèles de langage actuels.

Durée du cours : 8h

Ce que vous allez apprendre

  • Calculer une attention à partir des requêtes, clés et valeurs
  • Expliquer ce que l'attention multi-têtes apporte de plus
  • Décrire le rôle de l'encodage de position
  • Distinguer architectures encodeur, décodeur et encodeur-décodeur
  • Mesurer le coût quadratique de l'attention et ses contournements

Prérequis

  • Fondamentaux du deep learning
  • Notions de traitement du langage

Modules du cours

  1. Les limites des réseaux récurrents que l'attention lève
  2. Requête, clé, valeur : l'attention pas à pas
  3. Attention multi-têtes
  4. Encodage de position, absolu puis rotatif
  5. Connexions résiduelles et normalisation par couche
  6. L'encodeur : BERT et les modèles de compréhension
  7. Le décodeur : GPT et la génération
  8. Encodeur-décodeur : T5 et la traduction
  9. Coût quadratique et attention efficace
  10. Implémentation d'un bloc Transformer complet

Évaluation et attestation

Le parcours se termine par un examen de 40 questions qui couvre tous les modules. En cas de réussite, une attestation d'achèvement est délivrée ; son numéro est vérifiable sur la plateforme.

Les cours gratuits, eux, se concluent par un quiz de 5 questions avec un aperçu de l'attestation, sans certification.