Aller au contenu principal

Leçon 5 — Lire la notation

La barrière la plus concrète entre vous et la littérature du domaine n'est pas la difficulté des idées : c'est la notation. Les concepts d'un article de machine learning sont souvent simples ; leur habillage symbolique les rend intimidants. Cette leçon lève l'obstacle.

La bonne nouvelle

La notation en machine learning est remarquablement standardisée. Une trentaine de symboles couvrent la quasi-totalité de ce que vous lirez, et ils gardent le même sens d'un article à l'autre. Il s'agit d'un vocabulaire, pas d'une compétence.

Les symboles que vous verrez partout

Les objets

SymboleCe qu'il désigneEn clair
xune entrée, un exemplela description d'un objet, souvent un vecteur
yla sortie attendue, l'étiquettela bonne réponse
ŷ (y avec chapeau)la prédiction du modèlece que le modèle a répondu
Xl'ensemble des entréestout le jeu de données, sous forme de matrice
n ou Nle nombre d'exemplesla taille du jeu de données
dla dimensionle nombre de variables décrivant un exemple
θ (thêta)les paramètres du modèlel'ensemble des nombres que l'entraînement ajuste
W et bpoids et biaisles paramètres d'une couche : la matrice et le décalage

La règle typographique qui porte du sens : les scalaires sont en italique minuscule, les vecteurs en gras minuscule, les matrices en majuscule. Voir passer un objet du gras au non-gras dans une formule est une information sur sa nature, pas un caprice d'éditeur.

Les opérations

SymboleNomEn clair
Σsomme« additionne tout ce qui suit, pour chaque valeur de l'indice »
Πproduitmême chose, en multipliant
nabla, gradient« la liste de toutes les pentes » — la leçon 3
dérivée partielle« la pente selon une seule variable, les autres figées »
‖x‖normela longueur d'un vecteur
xᵀtransposéeon retourne le vecteur ou la matrice pour que la multiplication tombe juste
𝔼espérancela moyenne pondérée par les probabilités — la leçon 4
loglogarithmeapparaît partout dans les fonctions de perte, pour transformer un produit de probabilités en somme

Les mots-clés déguisés

NotationCe que ça veut dire
arg min« la valeur de l'argument qui rend cette quantité minimale » — c'est la définition de l'entraînement
arg maxidem, pour le maximum — c'est la décision d'un classifieur
s.t. ou « tel que »une contrainte à respecter
i.i.d.les exemples sont indépendants et tirés de la même distribution — hypothèse implicite presque partout
p(y | x)la probabilité de la sortie sachant l'entrée — l'objet même que la plupart des modèles estiment

Un exemple décodé

Voici la formule la plus courante de tout le domaine, telle qu'elle apparaît dans un article :

θ* = arg minθ (1/n) Σi=1..n L( fθ(xi), yi )

Lisez-la de l'intérieur vers l'extérieur :

  1. fθ(xi) — le modèle, avec ses paramètres actuels, appliqué à l'exemple numéro i. C'est la prédiction.
  2. L( … , yi ) — la fonction de perte, qui compare cette prédiction à la vraie réponse et renvoie un nombre d'autant plus grand que l'erreur est grande.
  3. (1/n) Σi=1..n — on fait cela pour tous les exemples et on prend la moyenne.
  4. arg minθ — on cherche le réglage des paramètres qui rend cette moyenne minimale.

Traduction en français : « trouver les paramètres qui minimisent l'erreur moyenne du modèle sur le jeu d'entraînement ». C'est-à-dire, exactement, la définition de l'entraînement supervisé.

Le réflexe qui débloque tout

Devant une formule intimidante, ne la lisez pas de gauche à droite. Repérez d'abord la quantité qu'on minimise ou maximise, puis sur quoi porte la somme, puis ce que fait la fonction au cœur. Neuf fois sur dix, la formule dit une chose que vous auriez pu formuler en français en une phrase.

La méthode de lecture en trois passes

Personne, y compris les chercheurs, ne lit un article linéairement du début à la fin. La méthode efficace est incrémentale.

Première passe — cinq minutes. Titre, résumé, introduction, titres de sections, conclusion. Objectif unique : savoir quel problème l'article attaque et quelle est sa réponse. À la fin de cette passe, vous décidez s'il mérite plus de temps. La majorité des articles s'arrêtent ici, et c'est normal.

Deuxième passe — une heure. Vous lisez le corps en regardant les figures et les tableaux de résultats, et vous sautez les démonstrations. Vous notez les références que vous ne connaissez pas. Objectif : pouvoir résumer la méthode à quelqu'un, sans pouvoir la réimplémenter.

Troisième passe — plusieurs heures. Réservée aux articles qui comptent vraiment pour vous. Vous refaites mentalement le raisonnement, vous vérifiez les formules, vous questionnez les choix expérimentaux. C'est là que vous repérez ce que les auteurs ont sous-entendu.

Le raccourci le plus efficace

Pour un article récent, cherchez son implémentation avant de vous acharner sur les formules. Vingt lignes de PyTorch sont souvent plus claires qu'une page de notation, parce que le code ne peut pas rester vague. Les dépôts publics et Hugging Face couvrent l'essentiel des travaux qui ont eu un impact.

Ce qui n'est jamais écrit et qu'il faut deviner

Trois habitudes de la littérature méritent d'être connues, car elles expliquent bien des incompréhensions.

Les indices de lot sont omis. Un article écrit une formule pour un exemple unique ; le code la calcule pour 256 exemples à la fois. La première dimension d'un tenseur, presque toujours le lot, est simplement passée sous silence.

Les détails d'implémentation sont dans les annexes, ou nulle part. Taux d'apprentissage, schéma de décroissance, initialisation, augmentation de données : ces éléments changent souvent davantage les résultats que l'idée principale, et ils sont relégués en fin de document quand ils sont mentionnés.

Les comparaisons sont rarement à armes égales. La nouvelle méthode a été réglée avec soin, les méthodes concurrentes ont été reprises telles quelles. Ce n'est pas de la malhonnêteté, c'est une asymétrie d'attention, et elle explique une bonne partie des améliorations qui ne se reproduisent pas.


En trois phrases

La notation du machine learning est un vocabulaire d'une trentaine de symboles très stables, et non une compétence mathématique supplémentaire à acquérir. Le réflexe qui débloque la lecture consiste à repérer d'abord ce qu'on minimise, puis sur quoi porte la somme, puis ce que fait la fonction au cœur, ce qui ramène la plupart des formules à une phrase en français. Lisez en trois passes, cherchez l'implémentation avant de vous acharner sur les symboles, et méfiez-vous des comparaisons dans lesquelles seule la méthode proposée a été réglée avec soin.


SuiteLeçon 6 : récapitulatif et FAQ →