Aller au contenu principal

Chargement du lab visuel…

#regression-lineaireApprentissage supervisé

Ajuster une droite : moindres carrés, résidus, MSE, R² et descente de gradient — la première brique de tout apprentissage supervisé.

Ce que tu vas manipuler

  1. Bienvenue dans #regression-lineaire. À l'écran, à gauche : 40 points bleus (x, y) et une droite rose y = a·x + b qui les rate complètement (a = −1, b = 1). À droite : le bol de l'erreur. En chaque point (a, b), la hauteur de la nappe est la MSE, l'erreur quadratique moyenne de la droite correspondante ; la bille jaune, c'est notre droite actuelle, perchée haut sur la paroi. Ajuster une droite, c'est faire glisser cette bille jusqu'au fond du bol. Un réseau de neurones fait exactement la même chose… dans un bol à plusieurs millions de dimensions.
  2. Rends l'erreur visible : tape /residus. Chaque segment jaune relie un point à la prédiction de la droite juste au-dessus ou au-dessous : c'est le résidu y − ŷ. La MSE est la moyenne des carrés de ces longueurs.
  3. Corrige la pente à la main : /pente 1.5. La droite pivote, les segments jaunes se raccourcissent, et la bille descend d'un coup sur la nappe : la MSE chute. Le biais b, lui, n'a pas bougé.
  4. Régler deux nombres à la main, ça va. Un million, non. Laisse l'algorithme travailler : /pas 10. À chaque pas, la descente de gradient calcule la pente de la MSE par rapport à a et à b, puis avance dans la direction opposée d'une longueur lr × gradient (ici lr = 0.1).
  5. Pour une droite, on n'a même pas besoin de descendre pas à pas : les moindres carrés ont une formule fermée. a* = Σ(x − x̄)(y − ȳ) / Σ(x − x̄)² et b* = ȳ − a*·x̄. Tape /solution : la bille saute exactement au fond du bol.
  6. La formule a un talon d'Achille. Tape /dataset aberrants : trois points rouges, très éloignés, rejoignent le nuage et le bol se déforme. Relance ensuite /solution pour voir où atterrit la « meilleure » droite : ces trois points la tirent vers eux.
  7. Dernier piège : /dataset courbe, puis /solution. Les points suivent une parabole, et la meilleure droite possible reste à côté : les résidus sont tous du même signe aux extrémités et de l'autre au milieu. C'est le sous-apprentissage : le modèle est trop simple pour les données. Il faudrait un terme en … ou un réseau de neurones.
  8. À toi de jouer : /dataset lineaire puis /pente -2, /lr 0.3 et /pas 20 (au bord de l'instabilité : la bille zigzague d'une paroi à l'autre) ; de nouveau /pente -2, puis /lr 0.5 et /pas 5 (chaque pas amplifie l'erreur : ça diverge) ; /bruit 1.5 (le fond du bol remonte) ; /points 200 (la droite optimale se stabilise) ; /graine 12 pour un autre tirage ; /reinit pour repartir. Ensuite : #regression-logistique (la même droite, mais pour classer) et #descente-de-gradient (le même bol, en bien plus tordu).

Commandes du canal

  • /pente <a=-3..3>Fixe la pente a de la droite (le biais ne bouge pas).
  • /biais <b=-3..3>Fixe le biais b (l'ordonnée à l'origine) de la droite.
  • /residusAffiche ou masque les résidus (segments jaunes point → droite).
  • /pas <n=1..50>Effectue n pas de descente de gradient sur (a, b) avec le taux lr.
  • /lr <0.001..1>Fixe le taux d'apprentissage (learning rate) de la descente.
  • /solutionSaute à la solution exacte des moindres carrés (fond du bol).
  • /dataset <lineaire|courbe|aberrants>Change le jeu de données (la droite courante est conservée).
  • /bruit <0..2>Fixe l'écart-type du bruit gaussien ajouté aux y.
  • /points <n=10..200>Fixe le nombre de points du nuage.
  • /graine <1..99>Change la graine du tirage aléatoire (autre nuage, mêmes réglages).
  • /reinitRevient au nuage linéaire de 40 points et à la droite a = −1, b = 1.

Glossaire

Régression linéaire
Modèle qui prédit une valeur numérique par une combinaison linéaire des entrées : ici ŷ = a·x + b. C'est la brique la plus simple de l'apprentissage supervisé, et un réseau de neurones sans activation n'est rien d'autre.
Moindres carrés
Méthode qui choisit la droite minimisant la somme des carrés des résidus. Pour une droite, la solution a une formule fermée : a* = Σ(x − x̄)(y − ȳ) / Σ(x − x̄)², b* = ȳ − a*·x̄.
Résidu
Écart y − ŷ entre la valeur observée et la prédiction, pour un point donné. Sur la scène, c'est le segment vertical jaune entre un point et la droite.
MSE (erreur quadratique moyenne)
Moyenne des carrés des résidus : MSE = (1/n) Σ (yᵢ − ŷᵢ)². C'est la fonction de perte que la régression minimise ; sa racine (RMSE) s'exprime dans l'unité de y.
R² (coefficient de détermination)
Part de la variance des y expliquée par le modèle : R² = 1 − SSE / SST. Vaut 1 pour un ajustement parfait, 0 quand la droite ne fait pas mieux que la moyenne ȳ, et devient négatif quand elle fait pire.
Pente et biais (a, b)
Les deux paramètres de la droite. La pente a (ou coefficient) dit de combien ŷ varie quand x augmente de 1 ; le biais b (ordonnée à l'origine) est la valeur prédite en x = 0. Dans un réseau, ce sont un poids et un biais.
Descente de gradient
Algorithme d'optimisation qui répète paramètre ← paramètre − lr × ∂perte/∂paramètre. Sur le bol de la MSE, chaque pas descend la pente locale jusqu'au fond. Indispensable quand il n'existe pas de formule fermée.
Taux d'apprentissage
Facteur lr qui règle la longueur de chaque pas de descente. Trop petit : convergence lente ; trop grand : zigzags, puis divergence. Pour la MSE, la descente n'est stable que si lr < 2 / λmax de la hessienne.
Valeur aberrante
Point très éloigné du reste des données (erreur de mesure, cas exceptionnel). Comme la MSE élève les résidus au carré, quelques valeurs aberrantes suffisent à tirer la droite des moindres carrés vers elles.
Sous-apprentissage
Situation où le modèle est trop simple pour la structure des données : une droite sur une parabole. L'erreur reste élevée même à l'optimum, et les résidus ont une structure visible (même signe par zones). Le remède est un modèle plus riche, pas un meilleur optimiseur.

Autres canaux du thème Apprentissage supervisé

  • #entrainement-liveSix algorithmes qui apprennent sous tes yeux, comme une vidéo : REC, timecode, sous-titres, métriques en direct. Regarder est gratuit ; toucher au modèle est Premium.
  • #regression-lineaireAjuster une droite : moindres carrés, résidus, MSE, R² et descente de gradient — la première brique de tout apprentissage supervisé.
  • #regression-logistiqueClasser en deux catégories : sigmoïde, frontière de décision, seuil et log-loss — et pourquoi une droite ne suffit pas toujours.
  • #arbres-de-decisionUn arbre qui découpe le plan en rectangles : Gini, entropie, profondeur, élagage — et le sur-apprentissage qu'on voit à l'œil nu.
  • #knnLes k plus proches voisins : classer par ressemblance, choisir k, changer de distance — et voir la frontière se lisser ou se déchirer.
  • #svm-margesMachines à vecteurs de support : la plus large marge possible, le paramètre C, et le noyau RBF qui courbe la frontière.
  • #metriques-classificationPrécision, rappel, F1, matrice de confusion, ROC et AUC : lire honnêtement un classifieur, surtout quand les classes sont déséquilibrées.