Aller au contenu principal

Module 7 — Probabilités, indépendance et probabilité conditionnelle

L'apprentissage automatique est, au fond, un raisonnement sous incertitude : un classifieur ne dit pas « c'est un chat » mais « 92 % de chance que ce soit un chat ». Les probabilités sont le langage de cette incertitude. Ce module en pose les bases, orientées vers ce qui sert réellement à comprendre les modèles.

La probabilité : une mesure entre 0 et 1

Une probabilité quantifie la vraisemblance d'un événement, de 0 (impossible) à 1 (certain). Deux lectures coexistent et se rejoignent en pratique :

  • Fréquentiste : la proportion observée sur de nombreuses répétitions (une pièce équilibrée tombe sur pile environ 1 fois sur 2).
  • Bayésienne : un degré de croyance, révisable à la lumière de nouvelles données — la vision du module 8.

En apprentissage, la sortie d'un modèle de classification est une probabilité, et savoir la lire correctement change tout dans l'interprétation d'une prédiction.

Probabilité conjointe et indépendance

La probabilité conjointe P(A et B)P(A \text{ et } B) est celle que deux événements se produisent ensemble. Deux événements sont indépendants si l'un n'apporte aucune information sur l'autre ; alors, et alors seulement :

P(A et B)=P(A)P(B)P(A \text{ et } B) = P(A) \cdot P(B)

Deux jets de dé successifs sont indépendants : le premier résultat ne dit rien du second. En revanche, « il pleut » et « le sol est mouillé » ne le sont pas du tout. Distinguer les deux cas est crucial : supposer à tort l'indépendance est une source majeure d'erreurs — mais c'est aussi, parfois, une simplification féconde, comme dans le classifieur bayésien « naïf » du module 8.

La probabilité conditionnelle : le cœur de l'inférence

La probabilité conditionnelle P(AB)P(A \mid B) se lit « probabilité de A sachant que B est vrai ». C'est la notion la plus importante du module, parce que prédire, c'est exactement calculer une probabilité conditionnelle : P(classecaracteˊristiques observeˊes)P(\text{classe} \mid \text{caractéristiques observées}).

P(AB)=P(A et B)P(B)P(A \mid B) = \frac{P(A \text{ et } B)}{P(B)}

Un exemple médical rend l'idée concrète. La probabilité qu'un patient soit malade, sachant que son test est positif, n'est pas la même que la probabilité brute d'être malade : l'information « test positif » a mis à jour notre estimation. Cette réévaluation à la lumière d'une observation est le mécanisme central de tout raisonnement prédictif.

# Sur des données : P(achat | a_vu_la_pub)
clients_ayant_vu = df[df["a_vu_pub"] == 1]
p_achat_sachant_pub = clients_ayant_vu["a_achete"].mean()

Un piège classique : la probabilité conditionnelle n'est pas symétrique

P(AB)P(A \mid B) et P(BA)P(B \mid A) sont différentes, et les confondre mène à des erreurs graves. P(test positifmalade)P(\text{test positif} \mid \text{malade}) — la fiabilité du test — peut être de 99 %, alors que P(maladetest positif)P(\text{malade} \mid \text{test positif}) — ce qui intéresse le patient — peut n'être que de 30 % si la maladie est rare. Le lien exact entre ces deux quantités est précisément le théorème de Bayes, objet du module suivant.

Pourquoi cela irrigue toute l'évaluation

Les métriques du cours d'introduction — précision, rappel — sont des probabilités conditionnelles déguisées. Le rappel est P(deˊtecteˊreˊellement positif)P(\text{détecté} \mid \text{réellement positif}) ; la précision est P(reˊellement positifdeˊtecteˊ)P(\text{réellement positif} \mid \text{détecté}). Ce sont les deux directions du conditionnement, et c'est pourquoi elles diffèrent et ne se résument jamais à un seul chiffre.

En résumé

  • Une probabilité mesure l'incertitude entre 0 et 1 ; la sortie d'un classifieur est une probabilité qu'il faut savoir interpréter.
  • Deux événements sont indépendants quand P(A et B)=P(A)P(B)P(A \text{ et } B) = P(A)P(B) ; le supposer à tort est une erreur fréquente.
  • La probabilité conditionnelle P(AB)P(A \mid B) est le cœur de la prédiction : classer, c'est estimer P(classecaracteˊristiques)P(\text{classe} \mid \text{caractéristiques}).
  • Elle n'est pas symétrique : P(AB)P(BA)P(A \mid B) \neq P(B \mid A) ; confondre les deux mène à de graves méprises, que le théorème de Bayes dissipe.

Module suivant : le théorème de Bayes, la formule qui relie les deux directions du conditionnement et fonde tout un pan de l'IA.