Leçon 5 — Lire la notation
La barrière la plus concrète entre vous et la littérature du domaine n'est pas la difficulté des idées : c'est la notation. Les concepts d'un article de machine learning sont souvent simples ; leur habillage symbolique les rend intimidants. Cette leçon lève l'obstacle.
La bonne nouvelle
La notation en machine learning est remarquablement standardisée. Une trentaine de symboles couvrent la quasi-totalité de ce que vous lirez, et ils gardent le même sens d'un article à l'autre. Il s'agit d'un vocabulaire, pas d'une compétence.
Les symboles que vous verrez partout
Les objets
| Symbole | Ce qu'il désigne | En clair |
|---|---|---|
| x | une entrée, un exemple | la description d'un objet, souvent un vecteur |
| y | la sortie attendue, l'étiquette | la bonne réponse |
| ŷ (y avec chapeau) | la prédiction du modèle | ce que le modèle a répondu |
| X | l'ensemble des entrées | tout le jeu de données, sous forme de matrice |
| n ou N | le nombre d'exemples | la taille du jeu de données |
| d | la dimension | le nombre de variables décrivant un exemple |
| θ (thêta) | les paramètres du modèle | l'ensemble des nombres que l'entraînement ajuste |
| W et b | poids et biais | les paramètres d'une couche : la matrice et le décalage |
La règle typographique qui porte du sens : les scalaires sont en italique minuscule, les vecteurs en gras minuscule, les matrices en majuscule. Voir passer un objet du gras au non-gras dans une formule est une information sur sa nature, pas un caprice d'éditeur.
Les opérations
| Symbole | Nom | En clair |
|---|---|---|
| Σ | somme | « additionne tout ce qui suit, pour chaque valeur de l'indice » |
| Π | produit | même chose, en multipliant |
| ∇ | nabla, gradient | « la liste de toutes les pentes » — la leçon 3 |
| ∂ | dérivée partielle | « la pente selon une seule variable, les autres figées » |
| ‖x‖ | norme | la longueur d'un vecteur |
| xᵀ | transposée | on retourne le vecteur ou la matrice pour que la multiplication tombe juste |
| 𝔼 | espérance | la moyenne pondérée par les probabilités — la leçon 4 |
| log | logarithme | apparaît partout dans les fonctions de perte, pour transformer un produit de probabilités en somme |
Les mots-clés déguisés
| Notation | Ce que ça veut dire |
|---|---|
| arg min | « la valeur de l'argument qui rend cette quantité minimale » — c'est la définition de l'entraînement |
| arg max | idem, pour le maximum — c'est la décision d'un classifieur |
| s.t. ou « tel que » | une contrainte à respecter |
| i.i.d. | les exemples sont indépendants et tirés de la même distribution — hypothèse implicite presque partout |
| p(y | x) | la probabilité de la sortie sachant l'entrée — l'objet même que la plupart des modèles estiment |
Un exemple décodé
Voici la formule la plus courante de tout le domaine, telle qu'elle apparaît dans un article :
θ* = arg minθ (1/n) Σi=1..n L( fθ(xi), yi )
Lisez-la de l'intérieur vers l'extérieur :
- fθ(xi) — le modèle, avec ses paramètres actuels, appliqué à l'exemple numéro i. C'est la prédiction.
- L( … , yi ) — la fonction de perte, qui compare cette prédiction à la vraie réponse et renvoie un nombre d'autant plus grand que l'erreur est grande.
- (1/n) Σi=1..n — on fait cela pour tous les exemples et on prend la moyenne.
- arg minθ — on cherche le réglage des paramètres qui rend cette moyenne minimale.
Traduction en français : « trouver les paramètres qui minimisent l'erreur moyenne du modèle sur le jeu d'entraînement ». C'est-à-dire, exactement, la définition de l'entraînement supervisé.
Devant une formule intimidante, ne la lisez pas de gauche à droite. Repérez d'abord la quantité qu'on minimise ou maximise, puis sur quoi porte la somme, puis ce que fait la fonction au cœur. Neuf fois sur dix, la formule dit une chose que vous auriez pu formuler en français en une phrase.
La méthode de lecture en trois passes
Personne, y compris les chercheurs, ne lit un article linéairement du début à la fin. La méthode efficace est incrémentale.
Première passe — cinq minutes. Titre, résumé, introduction, titres de sections, conclusion. Objectif unique : savoir quel problème l'article attaque et quelle est sa réponse. À la fin de cette passe, vous décidez s'il mérite plus de temps. La majorité des articles s'arrêtent ici, et c'est normal.
Deuxième passe — une heure. Vous lisez le corps en regardant les figures et les tableaux de résultats, et vous sautez les démonstrations. Vous notez les références que vous ne connaissez pas. Objectif : pouvoir résumer la méthode à quelqu'un, sans pouvoir la réimplémenter.
Troisième passe — plusieurs heures. Réservée aux articles qui comptent vraiment pour vous. Vous refaites mentalement le raisonnement, vous vérifiez les formules, vous questionnez les choix expérimentaux. C'est là que vous repérez ce que les auteurs ont sous-entendu.
Pour un article récent, cherchez son implémentation avant de vous acharner sur les formules. Vingt lignes de PyTorch sont souvent plus claires qu'une page de notation, parce que le code ne peut pas rester vague. Les dépôts publics et Hugging Face couvrent l'essentiel des travaux qui ont eu un impact.
Ce qui n'est jamais écrit et qu'il faut deviner
Trois habitudes de la littérature méritent d'être connues, car elles expliquent bien des incompréhensions.
Les indices de lot sont omis. Un article écrit une formule pour un exemple unique ; le code la calcule pour 256 exemples à la fois. La première dimension d'un tenseur, presque toujours le lot, est simplement passée sous silence.
Les détails d'implémentation sont dans les annexes, ou nulle part. Taux d'apprentissage, schéma de décroissance, initialisation, augmentation de données : ces éléments changent souvent davantage les résultats que l'idée principale, et ils sont relégués en fin de document quand ils sont mentionnés.
Les comparaisons sont rarement à armes égales. La nouvelle méthode a été réglée avec soin, les méthodes concurrentes ont été reprises telles quelles. Ce n'est pas de la malhonnêteté, c'est une asymétrie d'attention, et elle explique une bonne partie des améliorations qui ne se reproduisent pas.
En trois phrases
La notation du machine learning est un vocabulaire d'une trentaine de symboles très stables, et non une compétence mathématique supplémentaire à acquérir. Le réflexe qui débloque la lecture consiste à repérer d'abord ce qu'on minimise, puis sur quoi porte la somme, puis ce que fait la fonction au cœur, ce qui ramène la plupart des formules à une phrase en français. Lisez en trois passes, cherchez l'implémentation avant de vous acharner sur les symboles, et méfiez-vous des comparaisons dans lesquelles seule la méthode proposée a été réglée avec soin.
Suite — Leçon 6 : récapitulatif et FAQ →