#embeddings-3d — Réseaux de neurones
Un mot devient un vecteur : proches dans l'espace = proches en sens, et on peut calculer dessus.
Ce que tu vas manipuler
- Bienvenue dans #embeddings-3d. Chaque point est un mot, et sa position n'est pas arbitraire : un modèle de langage transforme chaque mot en vecteur (une liste de nombres), et deux mots proches en sens se retrouvent proches dans l'espace. Ici c'est une projection 3D simplifiée, construite pour être lisible — les vrais embeddings ont 768 dimensions ou plus. La scène tourne toute seule ; tape
/tournerpour l'arrêter. - Commençons par un mot. Tape
/mot chat: je le mets en surbrillance et je calcule ses 5 voisins les plus proches (similarité cosinus). - Changeons de famille :
/mot Paris. Ses voisins sont les autres capitales… et remarque la France juste en dessous, dans le nuage bleu des pays. - Tape
/lienspour tracer un trait entre chaque pays et sa capitale. Les traits sont tous parallèles : la relation « capitale de » est UNE direction dans l'espace. Même chose pour roi → reine, homme → femme, prince → princesse. - Puisque « capitale de » est une flèche, on peut la copier sur un autre pays. Tape
/analogie Paris France Italie: je calculeParis − France + Italieet je cherche le mot le plus proche du résultat. - C'est de l'arithmétique sur du sens. L'exemple historique de word2vec (Mikolov, 2013) :
/analogie roi homme femme. Le modèle n'a jamais lu de dictionnaire, il a juste vu des milliards de phrases. - Pour isoler un nuage, filtre :
/cluster emotions. Les autres familles s'estompent. Ensuite, explore librement :/mot joie,/distance joie tristesse,/distance chat Paris… - Tu as tout vu : un mot = un vecteur, proches = même sens, une relation = une direction. Les LLM font exactement ça, mais avec des milliers de dimensions et des phrases entières — c'est la première couche de tout transformeur, celle qui nourrit les neurones du canal #neurone. Continue à jouer :
/analogie Tokyo Japon Canada,/mot médecin,/cluster tous,/reinit.
Commandes du canal
/mot <mot>— Met un mot en surbrillance et affiche ses 5 voisins (cosinus)./analogie <a> <b> <c>— Calcule a − b + c et trouve le mot le plus proche du résultat./cluster <animaux|villes|pays|royaute|emotions|metiers|tous>— Ne garde en couleur qu'une seule famille de mots./liens— Affiche ou masque les traits pays→capitale et masculin→féminin./tourner— Démarre ou arrête la rotation automatique de la scène./distance <a> <b>— Similarité cosinus entre deux mots, avec interprétation./reinit— Efface sélection, analogie et filtre ; relance la rotation.
Glossaire
- Embedding
- Représentation d'un mot (ou d'un token, d'une image…) par un vecteur de nombres, appris pour que des éléments de sens proche aient des vecteurs proches.
- Espace vectoriel
- L'ensemble des vecteurs possibles. Un embedding de dimension 300 vit dans un espace à 300 dimensions ; ici on projette en 3D pour le voir.
- Similarité cosinus
- Cosinus de l'angle entre deux vecteurs : 1 = même direction, 0 = orthogonaux, −1 = opposés. Mesure standard de proximité sémantique, insensible à la longueur.
- Analogie vectorielle
roi − homme + femme ≈ reine: les relations (genre, capitale, pluriel) deviennent des directions constantes dans l'espace.- Word2vec
- Méthode (2013) qui apprend des embeddings en prédisant un mot à partir de ses voisins (CBOW) ou l'inverse (skip-gram). « Un mot se reconnaît à ses fréquentations. »
- Hypothèse distributionnelle
- Deux mots qui apparaissent dans les mêmes contextes ont des sens proches. C'est le principe qui permet d'apprendre le sens sans dictionnaire.
- Dimension
- Nombre de coordonnées d'un vecteur. Plus de dimensions = plus de nuances représentables, mais plus de données nécessaires. Typiquement 100 à 4 096.
- Réduction de dimension
- Projeter des vecteurs de grande dimension en 2D ou 3D pour les visualiser (PCA, t-SNE, UMAP), en perdant le moins d'information possible.
- Plus proches voisins
- Les mots dont le vecteur est le plus proche d'un mot donné. Les lister est le test le plus simple de la qualité d'un embedding.
Autres canaux du thème Réseaux de neurones
- #neurone — Décomposons un neurone : entrées, poids, somme, activation.
- #dropout — Régularisation par dropout : le meilleur ami des réseaux profonds.
- #activation — Pourquoi une activation ? ReLU, sigmoid, tanh, Leaky ReLU, GELU et le gradient qui disparaît.
- #descente-de-gradient — La perte est un paysage. Le gradient dit où ça monte, on fait un pas dans l'autre sens.
- #rétropropagation — Le graphe de calcul rejoué à l'envers : chaque nœud reçoit ∂L/∂(lui) et la règle de la chaîne fait le reste.
- #sur-apprentissage — Un gros modèle sur peu de données : la frontière de décision se tord jusqu'à mémoriser le bruit.
- #cnn-filtres — Une image est une grille de nombres. Un filtre 3×3 glisse dessus, multiplie, additionne : c'est une convolution.
- #is-it-einstein — Is it Einstein ? Deux visages passent au scanner d’un réseau qui n’a appris qu’Einstein : Haythem → NON, Einstein → OUI. Regarder est gratuit ; toucher est Premium.
- #embeddings-3d — Un mot devient un vecteur : proches dans l'espace = proches en sens, et on peut calculer dessus.