Aller au contenu principal

Module 10 — Compromis biais-variance, démontré sur un exemple

Voici le module où tout le cours converge. Le sur-apprentissage et le sous-apprentissage, décrits intuitivement dans le cours d'introduction, trouvent ici leur explication mathématique exacte : l'erreur d'un modèle se décompose en deux termes antagonistes, le biais et la variance, et savoir apprendre, c'est savoir les équilibrer.

Décomposer l'erreur

L'erreur qu'un modèle commet sur des données nouvelles se sépare en trois parts :

Erreur=Biais2+Variance+bruit irreˊductible\text{Erreur} = \text{Biais}^2 + \text{Variance} + \text{bruit irréductible}
  • Le biais mesure l'erreur due à des hypothèses trop simples : le modèle est trop rigide pour capter la vraie structure des données.
  • La variance mesure la sensibilité du modèle aux données d'entraînement précises : change un peu l'échantillon, et le modèle change beaucoup.
  • Le bruit irréductible est l'aléa inhérent aux données, qu'aucun modèle ne peut supprimer.

On ne peut agir que sur les deux premiers, et — c'est tout l'enjeu — ils tirent en sens contraire.

L'exemple de la cible : quatre situations

L'image classique est une cible fléchée. Le centre est la vérité ; chaque flèche est le modèle entraîné sur un échantillon différent.

  • Biais faible, variance faible : flèches groupées au centre. L'idéal.
  • Biais élevé, variance faible : flèches groupées, mais loin du centre. Le modèle est constant… et constamment faux : sous-apprentissage.
  • Biais faible, variance élevée : flèches centrées en moyenne, mais éparpillées. Le modèle vise juste globalement, mais dépend trop de l'échantillon : sur-apprentissage.
  • Biais élevé, variance élevée : le pire, éparpillé et décentré.

La courbe en U : le cœur du compromis

Plus un modèle est complexe (plus de paramètres, plus de souplesse), plus son biais baisse — il épouse mieux les données. Mais sa variance monte — il colle aux détails et au bruit de l'échantillon. L'erreur totale suit une courbe en U :

Le point optimal n'est ni le modèle le plus simple, ni le plus complexe, mais celui qui minimise la somme. C'est exactement ce que révèle l'écart entre l'erreur d'entraînement et l'erreur de validation, décrit dans le cours d'introduction : un grand écart trahit une variance excessive (sur-apprentissage) ; deux erreurs élevées et proches trahissent un biais excessif (sous-apprentissage).

Les leviers pour équilibrer

Ce compromis n'est pas une fatalité subie ; on le pilote :

  • Réduire la variance : plus de données d'entraînement, régularisation (L1L_1/L2L_2, qui pénalise les poids trop grands — un usage direct des normes du module 3), modèles d'ensemble comme les forêts aléatoires.
  • Réduire le biais : modèle plus expressif, meilleures caractéristiques (le cours d'ingénierie des caractéristiques), entraînement plus long.

La régularisation mérite une mention spéciale : elle ajoute au coût une pénalité sur la taille des poids, forçant le modèle à rester simple. C'est le contrôle le plus direct de la variance, et l'un des outils les plus utilisés en pratique.

Le fil rouge de tout le cours

Ce compromis est la raison d'être des mathématiques de ce cours. L'algèbre linéaire construit le modèle (modules 1-4) ; le calcul différentiel l'entraîne (modules 5-6) ; les probabilités et statistiques évaluent son incertitude et sa dispersion (modules 7-9). Le compromis biais-variance est la synthèse : il dit pourquoi un modèle plus puissant n'est pas toujours meilleur, et pourquoi juger un modèle exige toujours des données qu'il n'a jamais vues.

En résumé

  • L'erreur se décompose en biais² (hypothèses trop simples), variance (sensibilité à l'échantillon) et bruit irréductible.
  • Biais et variance s'opposent : la complexité baisse le biais mais monte la variance, d'où une courbe en U de l'erreur totale.
  • Biais élevé = sous-apprentissage ; variance élevée = sur-apprentissage ; l'optimum équilibre les deux, révélé par l'écart entraînement/validation.
  • On pilote le compromis : plus de données et régularisation contre la variance ; modèle plus expressif et meilleures caractéristiques contre le biais.

Module suivant : la récapitulation générale et l'examen qui valide votre maîtrise des mathématiques de l'IA.