Aller au contenu principal

Chargement du lab visuel…

#entrainement-liveApprentissage supervisé

Six algorithmes qui apprennent sous tes yeux, comme une vidéo : REC, timecode, sous-titres, métriques en direct. Regarder est gratuit ; toucher au modèle est Premium.

Ce que tu vas manipuler

  1. Bienvenue dans #entrainement-live 🎬. Ici, pour une fois, tu ne règles rien au départ : tu regardes. La scène joue un film en six épisodes, un par algorithme : une droite qui apprend à prédire un prix, une frontière qui sépare réussite et échec, une carte de voisins qui se dessine ligne par ligne, un arbre qui découpe le plan, une forêt qui vote, et une marge qui s'élargit. Pastille REC, timecode, sous-titres, métriques en direct : chaque épisode dure moins d'une minute et le suivant s'enchaîne. Regarder est gratuit, en boucle, autant que tu veux. Toucher au modèle — taux d'apprentissage, k, profondeur, marge, prédire un point — c'est Premium : si tu essaies, je te le dirai avec un « Oups ».
  2. Le film tourne. Mets-le en pause quand tu veux : /pause. La pastille REC laisse la place à PAUSE, le timecode se fige, et tu peux lire les métriques tranquillement.
  3. Accélère : /vitesse 2. Le nombre d'images par seconde double. Les épisodes lents (l'arbre pose une coupe toutes les 0,8 s) deviennent nerveux ; les descentes de gradient filent.
  4. Saute directement à un épisode : /episode knn. Le film reprend au début de l'épisode 3 : les k plus proches voisins n'ont rien à entraîner, alors on regarde la carte de décision se calculer pixel par pixel, puis une fleur inconnue chercher ses voisines.
  5. Un détail t'a échappé ? /rejouer relance l'épisode courant depuis la première image. Même graine, même tirage, même film : c'est déterministe, exprès — pour comparer, il faut revoir la même chose.
  6. À toi. Côté spectateur (gratuit) : /episode arbre, /episode foret, /episode svm, /vitesse 0.5, /soustitres pour couper ou remettre les sous-titres, /enchainer pour boucler ou s'arrêter en fin d'épisode. Côté réalisateur (Premium) : /lr 0.05 une descente prudente, /lr 1 une descente qui déraille, /k 1 des frontières nerveuses, /profondeur 6 un arbre qui sur-apprend, /arbres 40 une forêt dense, /marge 20 une marge intransigeante, /bruit 0.9 des données mélangées, /graine 12 un autre tirage, /predire 0.7 0.3 pour poser une étoile et lire le verdict du modèle. Oups… ceux-là, il faut l'abonnement — je te dirai comment. Ensuite : #regression-lineaire pour manipuler la droite en 3D, ou #knn pour régler k toi-même.

Commandes du canal

  • /episode <lineaire|logistique|knn|arbre|foret|svm|suivant>Saute à un épisode (ou au suivant) et le joue depuis le début.
  • /pauseMet le film en pause (le timecode se fige).
  • /lectureReprend la lecture du film.
  • /vitesse <0.5|1|2|4>Vitesse de lecture : 0.5 (ralenti) à 4 (accéléré).
  • /rejouerRelance l’épisode courant depuis la première image (même tirage).
  • /soustitresAffiche ou masque les sous-titres pédagogiques.
  • /enchainerActive ou coupe l’enchaînement automatique des épisodes.
  • /reinitRevient au premier épisode et aux réglages par défaut.
  • /lr <0.01..1>🔒 Premium · Taux d’apprentissage des descentes de gradient (épisodes 1, 2, 6).
  • /bruit <0..1>🔒 Premium · Étalement des données : 0 = nuages nets, 1 = très mélangés.
  • /points <n=20..200>🔒 Premium · Nombre de points (un sur quatre sert au test).
  • /graine <1..99>🔒 Premium · Autre tirage aléatoire des données (mêmes réglages).
  • /k <1..15>🔒 Premium · Nombre de voisins de KNN (épisode 3).
  • /profondeur <1..6>🔒 Premium · Profondeur maximale de l’arbre de décision (épisode 4).
  • /arbres <1..40>🔒 Premium · Nombre d’arbres de la forêt aléatoire (épisode 5).
  • /marge <C=0.1..20>🔒 Premium · Constante C du SVM : pénalité des points dans la marge (épisode 6).
  • /predire <x=0..1> <y=0..1>🔒 Premium · Pose une étoile en (x, y) et lit la réponse du modèle entraîné.

Glossaire

Époque
Un passage complet sur les données d'entraînement, avec une mise à jour des paramètres. Dans le film, chaque image des épisodes 1, 2 et 6 est une époque : la droite ou la frontière bouge un peu à chacune.
Fonction de perte
Le nombre que l'entraînement cherche à faire baisser : MSE pour la régression, log-loss pour la régression logistique, perte charnière pour le SVM. La courbe qui descend à droite du film, c'est elle.
Convergence
Moment où les mises à jour deviennent négligeables : la perte ne bouge presque plus, le modèle est « arrivé ». Les derniers sous-titres des épisodes à descente de gradient la signalent.
Divergence
Quand le taux d'apprentissage est trop grand, chaque pas dépasse le fond du bol et remonte plus haut que le précédent : la perte explose. Le film s'arrête sur une droite rouge et un « Oups ».
Frontière de décision
La ligne (ou la surface) où le modèle change d'avis entre deux classes. Droite pour la régression logistique et le SVM linéaire, dentelée pour KNN, en escalier pour un arbre, floue puis nette pour une forêt.
Jeu de test
Points mis de côté (les cercles creux) que le modèle ne voit jamais pendant l'entraînement. C'est sur eux qu'on mesure l'exactitude honnête : bien classer ce qu'on a appris par cœur ne prouve rien.
Vecteur de support
Point d'entraînement situé sur la marge ou à l'intérieur (cerclé de jaune dans l'épisode 6). Ce sont les seuls points qui déterminent la frontière d'un SVM : supprimer les autres ne la déplacerait pas.
Indice de Gini
Mesure d'impureté d'un groupe de points : 0 si une seule classe, maximal si les classes sont à parts égales. Un arbre de décision choisit à chaque nœud la coupe qui fait le plus baisser l'impureté moyenne des deux moitiés.
Bootstrap et bagging
Tirer n points avec remise dans les n points d'origine donne un échantillon un peu différent ; entraîner un modèle par échantillon puis faire voter l'ensemble, c'est le bagging. La forêt aléatoire est un bagging d'arbres.

Autres canaux du thème Apprentissage supervisé

  • #entrainement-liveSix algorithmes qui apprennent sous tes yeux, comme une vidéo : REC, timecode, sous-titres, métriques en direct. Regarder est gratuit ; toucher au modèle est Premium.
  • #regression-lineaireAjuster une droite : moindres carrés, résidus, MSE, R² et descente de gradient — la première brique de tout apprentissage supervisé.
  • #regression-logistiqueClasser en deux catégories : sigmoïde, frontière de décision, seuil et log-loss — et pourquoi une droite ne suffit pas toujours.
  • #arbres-de-decisionUn arbre qui découpe le plan en rectangles : Gini, entropie, profondeur, élagage — et le sur-apprentissage qu'on voit à l'œil nu.
  • #knnLes k plus proches voisins : classer par ressemblance, choisir k, changer de distance — et voir la frontière se lisser ou se déchirer.
  • #svm-margesMachines à vecteurs de support : la plus large marge possible, le paramètre C, et le noyau RBF qui courbe la frontière.
  • #metriques-classificationPrécision, rappel, F1, matrice de confusion, ROC et AUC : lire honnêtement un classifieur, surtout quand les classes sont déséquilibrées.