#entrainement-live — Apprentissage supervisé
Six algorithmes qui apprennent sous tes yeux, comme une vidéo : REC, timecode, sous-titres, métriques en direct. Regarder est gratuit ; toucher au modèle est Premium.
Ce que tu vas manipuler
- Bienvenue dans #entrainement-live 🎬. Ici, pour une fois, tu ne règles rien au départ : tu regardes. La scène joue un film en six épisodes, un par algorithme : une droite qui apprend à prédire un prix, une frontière qui sépare réussite et échec, une carte de voisins qui se dessine ligne par ligne, un arbre qui découpe le plan, une forêt qui vote, et une marge qui s'élargit. Pastille REC, timecode, sous-titres, métriques en direct : chaque épisode dure moins d'une minute et le suivant s'enchaîne. Regarder est gratuit, en boucle, autant que tu veux. Toucher au modèle — taux d'apprentissage, k, profondeur, marge, prédire un point — c'est Premium : si tu essaies, je te le dirai avec un « Oups ».
- Le film tourne. Mets-le en pause quand tu veux :
/pause. La pastille REC laisse la place à PAUSE, le timecode se fige, et tu peux lire les métriques tranquillement. - Accélère :
/vitesse 2. Le nombre d'images par seconde double. Les épisodes lents (l'arbre pose une coupe toutes les 0,8 s) deviennent nerveux ; les descentes de gradient filent. - Saute directement à un épisode :
/episode knn. Le film reprend au début de l'épisode 3 : les k plus proches voisins n'ont rien à entraîner, alors on regarde la carte de décision se calculer pixel par pixel, puis une fleur inconnue chercher ses voisines. - Un détail t'a échappé ?
/rejouerrelance l'épisode courant depuis la première image. Même graine, même tirage, même film : c'est déterministe, exprès — pour comparer, il faut revoir la même chose. - À toi. Côté spectateur (gratuit) :
/episode arbre,/episode foret,/episode svm,/vitesse 0.5,/soustitrespour couper ou remettre les sous-titres,/enchainerpour boucler ou s'arrêter en fin d'épisode. Côté réalisateur (Premium) :/lr 0.05une descente prudente,/lr 1une descente qui déraille,/k 1des frontières nerveuses,/profondeur 6un arbre qui sur-apprend,/arbres 40une forêt dense,/marge 20une marge intransigeante,/bruit 0.9des données mélangées,/graine 12un autre tirage,/predire 0.7 0.3pour poser une étoile et lire le verdict du modèle. Oups… ceux-là, il faut l'abonnement — je te dirai comment. Ensuite : #regression-lineaire pour manipuler la droite en 3D, ou #knn pour régler k toi-même.
Commandes du canal
/episode <lineaire|logistique|knn|arbre|foret|svm|suivant>— Saute à un épisode (ou au suivant) et le joue depuis le début./pause— Met le film en pause (le timecode se fige)./lecture— Reprend la lecture du film./vitesse <0.5|1|2|4>— Vitesse de lecture : 0.5 (ralenti) à 4 (accéléré)./rejouer— Relance l’épisode courant depuis la première image (même tirage)./soustitres— Affiche ou masque les sous-titres pédagogiques./enchainer— Active ou coupe l’enchaînement automatique des épisodes./reinit— Revient au premier épisode et aux réglages par défaut./lr <0.01..1>— 🔒 Premium · Taux d’apprentissage des descentes de gradient (épisodes 1, 2, 6)./bruit <0..1>— 🔒 Premium · Étalement des données : 0 = nuages nets, 1 = très mélangés./points <n=20..200>— 🔒 Premium · Nombre de points (un sur quatre sert au test)./graine <1..99>— 🔒 Premium · Autre tirage aléatoire des données (mêmes réglages)./k <1..15>— 🔒 Premium · Nombre de voisins de KNN (épisode 3)./profondeur <1..6>— 🔒 Premium · Profondeur maximale de l’arbre de décision (épisode 4)./arbres <1..40>— 🔒 Premium · Nombre d’arbres de la forêt aléatoire (épisode 5)./marge <C=0.1..20>— 🔒 Premium · Constante C du SVM : pénalité des points dans la marge (épisode 6)./predire <x=0..1> <y=0..1>— 🔒 Premium · Pose une étoile en (x, y) et lit la réponse du modèle entraîné.
Glossaire
- Époque
- Un passage complet sur les données d'entraînement, avec une mise à jour des paramètres. Dans le film, chaque image des épisodes 1, 2 et 6 est une époque : la droite ou la frontière bouge un peu à chacune.
- Fonction de perte
- Le nombre que l'entraînement cherche à faire baisser : MSE pour la régression, log-loss pour la régression logistique, perte charnière pour le SVM. La courbe qui descend à droite du film, c'est elle.
- Convergence
- Moment où les mises à jour deviennent négligeables : la perte ne bouge presque plus, le modèle est « arrivé ». Les derniers sous-titres des épisodes à descente de gradient la signalent.
- Divergence
- Quand le taux d'apprentissage est trop grand, chaque pas dépasse le fond du bol et remonte plus haut que le précédent : la perte explose. Le film s'arrête sur une droite rouge et un « Oups ».
- Frontière de décision
- La ligne (ou la surface) où le modèle change d'avis entre deux classes. Droite pour la régression logistique et le SVM linéaire, dentelée pour KNN, en escalier pour un arbre, floue puis nette pour une forêt.
- Jeu de test
- Points mis de côté (les cercles creux) que le modèle ne voit jamais pendant l'entraînement. C'est sur eux qu'on mesure l'exactitude honnête : bien classer ce qu'on a appris par cœur ne prouve rien.
- Vecteur de support
- Point d'entraînement situé sur la marge ou à l'intérieur (cerclé de jaune dans l'épisode 6). Ce sont les seuls points qui déterminent la frontière d'un SVM : supprimer les autres ne la déplacerait pas.
- Indice de Gini
- Mesure d'impureté d'un groupe de points : 0 si une seule classe, maximal si les classes sont à parts égales. Un arbre de décision choisit à chaque nœud la coupe qui fait le plus baisser l'impureté moyenne des deux moitiés.
- Bootstrap et bagging
- Tirer n points avec remise dans les n points d'origine donne un échantillon un peu différent ; entraîner un modèle par échantillon puis faire voter l'ensemble, c'est le bagging. La forêt aléatoire est un bagging d'arbres.
Autres canaux du thème Apprentissage supervisé
- #entrainement-live — Six algorithmes qui apprennent sous tes yeux, comme une vidéo : REC, timecode, sous-titres, métriques en direct. Regarder est gratuit ; toucher au modèle est Premium.
- #regression-lineaire — Ajuster une droite : moindres carrés, résidus, MSE, R² et descente de gradient — la première brique de tout apprentissage supervisé.
- #regression-logistique — Classer en deux catégories : sigmoïde, frontière de décision, seuil et log-loss — et pourquoi une droite ne suffit pas toujours.
- #arbres-de-decision — Un arbre qui découpe le plan en rectangles : Gini, entropie, profondeur, élagage — et le sur-apprentissage qu'on voit à l'œil nu.
- #knn — Les k plus proches voisins : classer par ressemblance, choisir k, changer de distance — et voir la frontière se lisser ou se déchirer.
- #svm-marges — Machines à vecteurs de support : la plus large marge possible, le paramètre C, et le noyau RBF qui courbe la frontière.
- #metriques-classification — Précision, rappel, F1, matrice de confusion, ROC et AUC : lire honnêtement un classifieur, surtout quand les classes sont déséquilibrées.