Aller au contenu principal

Leçon 4 — Séquences et transformeurs

Une image a une taille fixe. Une phrase, non : elle peut compter cinq mots ou cinq cents, et l'ordre y est porteur de sens. « Le chien mord l'homme » et « l'homme mord le chien » contiennent les mêmes mots. Cette leçon retrace comment le domaine a résolu ce problème, jusqu'à l'architecture qui fait tourner ChatGPT.

Le problème des séquences

Trois exigences, qu'aucun réseau des leçons précédentes ne satisfait.

La longueur est variable. Un réseau entièrement connecté attend un nombre fixe d'entrées.

L'ordre compte. Une opération qui traiterait les mots comme un sac perdrait l'essentiel.

Les dépendances peuvent être lointaines. Dans « la clé que j'ai posée sur la table de la cuisine hier soir avant de partir est introuvable », l'accord du verbe dépend d'un mot situé onze mots plus tôt.

La solution récurrente, et sa limite

La première réponse, les réseaux récurrents (RNN), procède comme une lecture : on traite un mot, on met à jour une mémoire interne, on passe au mot suivant en emportant cette mémoire. À la fin, la mémoire résume la séquence.

L'idée est juste, et deux défauts l'ont condamnée.

L'oubli. La mémoire est un vecteur de taille fixe réécrit à chaque étape. Après quarante mots, l'information du début a été largement écrasée. Les LSTM et les GRU, inventés pour cela, ajoutent des portes qui décident quoi conserver et quoi oublier. Ils ont considérablement amélioré la situation et n'ont pas supprimé le problème sur les longues séquences.

L'impossibilité de paralléliser. C'est le défaut fatal. Pour traiter le mot 50, il faut avoir traité le mot 49, donc le 48, et ainsi de suite. Le calcul est intrinsèquement séquentiel, ce qui interdit d'exploiter les milliers de cœurs d'une carte graphique. Sur un corpus de milliards de mots, l'entraînement devient impraticable.

L'attention, ou la fin de la lecture séquentielle

En 2017, un article au titre volontairement tranchant, Attention Is All You Need, propose de renoncer à la récurrence. L'idée du mécanisme d'attention est la suivante.

Pour traiter un mot, on ne s'appuie pas sur une mémoire accumulée : on regarde tous les autres mots de la séquence en même temps, et on apprend à pondérer leur importance pour le mot courant.

Prenons « la clé que j'ai posée sur la table est introuvable ». Pour traiter « est », le mécanisme attribue un poids fort à « clé », un poids faible à « table », un poids négligeable à « sur ». Ces poids ne sont pas programmés : ils sont calculés à partir du contenu des mots, par des transformations apprises.

C'est exactement ce qui manquait pour la résolution des ambiguïtés. Dans « il a déposé de l'argent à la banque » et « il s'est assis sur la banque », le mot « banque » reçoit une attention différente selon son voisinage, et sa représentation interne diffère en conséquence.

Le gain décisif est la parallélisation. Tous les mots étant traités simultanément, l'opération se ramène à de grosses multiplications de matrices — exactement ce que les cartes graphiques font le mieux. Ce qui prenait des semaines devient réalisable, et l'échelle atteinte depuis 2018 en découle directement.

Ce que l'architecture ajoute autour

L'attention seule ne suffit pas. Un bloc de transformeur combine plusieurs éléments, et il est utile de savoir à quoi ils servent.

L'attention à plusieurs têtes. Plutôt qu'un seul mécanisme d'attention, on en fait tourner plusieurs en parallèle, chacun libre d'apprendre à regarder un type de relation différent : accords grammaticaux pour l'un, liens de coréférence pour l'autre, proximité thématique pour un troisième. Leurs sorties sont ensuite combinées.

L'encodage positionnel. Puisqu'on a renoncé à lire dans l'ordre, il faut réinjecter l'information de position, sinon le modèle traiterait la phrase comme un sac de mots. On ajoute donc à chaque mot un motif numérique qui code sa place dans la séquence.

Un réseau entièrement connecté appliqué à chaque position après l'attention, qui transforme les représentations obtenues.

Des connexions résiduelles et une normalisation, exactement celles de la leçon 2, sans lesquelles l'empilement de dizaines de blocs ne s'entraînerait pas.

Un modèle de langage moderne est cet ensemble, répété plusieurs dizaines de fois.

Le coût quadratique, et ce qu'il implique

L'attention a une contrepartie qu'il faut connaître, parce qu'elle explique une contrainte que vous rencontrerez concrètement.

Chaque mot regardant tous les autres, le nombre de comparaisons croît comme le carré de la longueur de la séquence. Doubler la longueur quadruple le coût. Passer de mille à cent mille mots le multiplie par dix mille.

C'est la raison technique de la fenêtre de contexte limitée des modèles de langage : ce n'est pas une décision commerciale arbitraire, c'est un mur de calcul et de mémoire. D'importants travaux visent à contourner ce coût — attention creuse, approximations linéaires, architectures à espace d'états — et les fenêtres se sont beaucoup allongées, mais la contrainte demeure structurelle.

Où l'on retrouve les transformeurs

L'architecture a débordé très au-delà du texte, ce qui est remarquable pour une invention conçue pour la traduction.

DomaineUsage
Textetous les grands modèles de langage, la traduction, le résumé
ImagesVision Transformer, découpant l'image en morceaux traités comme des mots
Audiotranscription et synthèse vocale
Multimodalmodèles traitant conjointement texte et image
Biologieprédiction de structure des protéines, où la séquence d'acides aminés joue le rôle de la phrase
Codegénération et complétion de programmes
Pourquoi une seule architecture partout

L'attention ne suppose presque rien sur la nature de ses entrées : elle demande seulement une collection d'éléments et une façon de mesurer leur pertinence mutuelle. Cette absence d'hypothèse est sa faiblesse — il lui faut beaucoup de données pour apprendre ce qu'une convolution sait par construction — et sa force : la même architecture s'applique à des protéines comme à des phrases.


En trois phrases

Les séquences posent trois problèmes — longueur variable, ordre significatif, dépendances lointaines — auxquels les réseaux récurrents répondaient par une mémoire mise à jour mot après mot, au prix d'un oubli progressif et surtout d'un calcul impossible à paralléliser. Le mécanisme d'attention remplace cette lecture séquentielle : chaque mot regarde tous les autres et apprend à pondérer leur importance, ce qui ramène l'opération à des multiplications de matrices parallélisables et a rendu possible l'entraînement sur des corpus immenses. Sa contrepartie est un coût qui croît comme le carré de la longueur, ce qui explique la limite de la fenêtre de contexte des modèles de langage.


SuiteLeçon 5 : coût réel et transfer learning →