#regression-lineaire — Apprentissage supervisé
Ajuster une droite : moindres carrés, résidus, MSE, R² et descente de gradient — la première brique de tout apprentissage supervisé.
Ce que tu vas manipuler
- Bienvenue dans #regression-lineaire. À l'écran, à gauche : 40 points bleus (x, y) et une droite rose
y = a·x + bqui les rate complètement (a = −1,b = 1). À droite : le bol de l'erreur. En chaque point (a, b), la hauteur de la nappe est la MSE, l'erreur quadratique moyenne de la droite correspondante ; la bille jaune, c'est notre droite actuelle, perchée haut sur la paroi. Ajuster une droite, c'est faire glisser cette bille jusqu'au fond du bol. Un réseau de neurones fait exactement la même chose… dans un bol à plusieurs millions de dimensions. - Rends l'erreur visible : tape
/residus. Chaque segment jaune relie un point à la prédiction de la droite juste au-dessus ou au-dessous : c'est le résiduy − ŷ. La MSE est la moyenne des carrés de ces longueurs. - Corrige la pente à la main :
/pente 1.5. La droite pivote, les segments jaunes se raccourcissent, et la bille descend d'un coup sur la nappe : la MSE chute. Le biaisb, lui, n'a pas bougé. - Régler deux nombres à la main, ça va. Un million, non. Laisse l'algorithme travailler :
/pas 10. À chaque pas, la descente de gradient calcule la pente de la MSE par rapport àaet àb, puis avance dans la direction opposée d'une longueurlr × gradient(icilr = 0.1). - Pour une droite, on n'a même pas besoin de descendre pas à pas : les moindres carrés ont une formule fermée.
a* = Σ(x − x̄)(y − ȳ) / Σ(x − x̄)²etb* = ȳ − a*·x̄. Tape/solution: la bille saute exactement au fond du bol. - La formule a un talon d'Achille. Tape
/dataset aberrants: trois points rouges, très éloignés, rejoignent le nuage et le bol se déforme. Relance ensuite/solutionpour voir où atterrit la « meilleure » droite : ces trois points la tirent vers eux. - Dernier piège :
/dataset courbe, puis/solution. Les points suivent une parabole, et la meilleure droite possible reste à côté : les résidus sont tous du même signe aux extrémités et de l'autre au milieu. C'est le sous-apprentissage : le modèle est trop simple pour les données. Il faudrait un terme enx²… ou un réseau de neurones. - À toi de jouer :
/dataset lineairepuis/pente -2,/lr 0.3et/pas 20(au bord de l'instabilité : la bille zigzague d'une paroi à l'autre) ; de nouveau/pente -2, puis/lr 0.5et/pas 5(chaque pas amplifie l'erreur : ça diverge) ;/bruit 1.5(le fond du bol remonte) ;/points 200(la droite optimale se stabilise) ;/graine 12pour un autre tirage ;/reinitpour repartir. Ensuite : #regression-logistique (la même droite, mais pour classer) et #descente-de-gradient (le même bol, en bien plus tordu).
Commandes du canal
/pente <a=-3..3>— Fixe la pente a de la droite (le biais ne bouge pas)./biais <b=-3..3>— Fixe le biais b (l'ordonnée à l'origine) de la droite./residus— Affiche ou masque les résidus (segments jaunes point → droite)./pas <n=1..50>— Effectue n pas de descente de gradient sur (a, b) avec le taux lr./lr <0.001..1>— Fixe le taux d'apprentissage (learning rate) de la descente./solution— Saute à la solution exacte des moindres carrés (fond du bol)./dataset <lineaire|courbe|aberrants>— Change le jeu de données (la droite courante est conservée)./bruit <0..2>— Fixe l'écart-type du bruit gaussien ajouté aux y./points <n=10..200>— Fixe le nombre de points du nuage./graine <1..99>— Change la graine du tirage aléatoire (autre nuage, mêmes réglages)./reinit— Revient au nuage linéaire de 40 points et à la droite a = −1, b = 1.
Glossaire
- Régression linéaire
- Modèle qui prédit une valeur numérique par une combinaison linéaire des entrées : ici
ŷ = a·x + b. C'est la brique la plus simple de l'apprentissage supervisé, et un réseau de neurones sans activation n'est rien d'autre. - Moindres carrés
- Méthode qui choisit la droite minimisant la somme des carrés des résidus. Pour une droite, la solution a une formule fermée :
a* = Σ(x − x̄)(y − ȳ) / Σ(x − x̄)²,b* = ȳ − a*·x̄. - Résidu
- Écart
y − ŷentre la valeur observée et la prédiction, pour un point donné. Sur la scène, c'est le segment vertical jaune entre un point et la droite. - MSE (erreur quadratique moyenne)
- Moyenne des carrés des résidus :
MSE = (1/n) Σ (yᵢ − ŷᵢ)². C'est la fonction de perte que la régression minimise ; sa racine (RMSE) s'exprime dans l'unité de y. - R² (coefficient de détermination)
- Part de la variance des y expliquée par le modèle :
R² = 1 − SSE / SST. Vaut 1 pour un ajustement parfait, 0 quand la droite ne fait pas mieux que la moyenne ȳ, et devient négatif quand elle fait pire. - Pente et biais (a, b)
- Les deux paramètres de la droite. La pente a (ou coefficient) dit de combien ŷ varie quand x augmente de 1 ; le biais b (ordonnée à l'origine) est la valeur prédite en x = 0. Dans un réseau, ce sont un poids et un biais.
- Descente de gradient
- Algorithme d'optimisation qui répète
paramètre ← paramètre − lr × ∂perte/∂paramètre. Sur le bol de la MSE, chaque pas descend la pente locale jusqu'au fond. Indispensable quand il n'existe pas de formule fermée. - Taux d'apprentissage
- Facteur
lrqui règle la longueur de chaque pas de descente. Trop petit : convergence lente ; trop grand : zigzags, puis divergence. Pour la MSE, la descente n'est stable que silr < 2 / λmaxde la hessienne. - Valeur aberrante
- Point très éloigné du reste des données (erreur de mesure, cas exceptionnel). Comme la MSE élève les résidus au carré, quelques valeurs aberrantes suffisent à tirer la droite des moindres carrés vers elles.
- Sous-apprentissage
- Situation où le modèle est trop simple pour la structure des données : une droite sur une parabole. L'erreur reste élevée même à l'optimum, et les résidus ont une structure visible (même signe par zones). Le remède est un modèle plus riche, pas un meilleur optimiseur.
Autres canaux du thème Apprentissage supervisé
- #entrainement-live — Six algorithmes qui apprennent sous tes yeux, comme une vidéo : REC, timecode, sous-titres, métriques en direct. Regarder est gratuit ; toucher au modèle est Premium.
- #regression-lineaire — Ajuster une droite : moindres carrés, résidus, MSE, R² et descente de gradient — la première brique de tout apprentissage supervisé.
- #regression-logistique — Classer en deux catégories : sigmoïde, frontière de décision, seuil et log-loss — et pourquoi une droite ne suffit pas toujours.
- #arbres-de-decision — Un arbre qui découpe le plan en rectangles : Gini, entropie, profondeur, élagage — et le sur-apprentissage qu'on voit à l'œil nu.
- #knn — Les k plus proches voisins : classer par ressemblance, choisir k, changer de distance — et voir la frontière se lisser ou se déchirer.
- #svm-marges — Machines à vecteurs de support : la plus large marge possible, le paramètre C, et le noyau RBF qui courbe la frontière.
- #metriques-classification — Précision, rappel, F1, matrice de confusion, ROC et AUC : lire honnêtement un classifieur, surtout quand les classes sont déséquilibrées.