Aller au contenu principal

Module 9 — Métriques : exactitude, précision, rappel, F1 et aire sous la courbe ROC

Un modèle ne vaut que ce que mesure sa métrique — et choisir la mauvaise conduit à optimiser la mauvaise chose. Ce module prolonge le cours d'introduction et le cours de mathématiques (les métriques sont des probabilités conditionnelles) pour outiller un choix lucide, surtout quand les classes sont déséquilibrées.

Pourquoi l'exactitude ment souvent

L'exactitude est la proportion de prédictions correctes. Intuitive, mais traître dès que les classes sont déséquilibrées. Sur un dépistage où 1 % des cas sont positifs, un modèle qui prédit toujours « négatif » atteint 99 % d'exactitude… en ne détectant aucun malade. Le chiffre est flatteur, le modèle inutile. Il faut donc regarder quelles erreurs sont commises, pas seulement combien.

La matrice de confusion : la source de tout

Toutes les métriques sérieuses dérivent de la matrice de confusion, qui croise prédictions et réalité :

Prédit positifPrédit négatif
Réel positifVrai positif (VP)Faux négatif (FN)
Réel négatifFaux positif (FP)Vrai négatif (VN)

Les deux erreurs n'ont pas le même coût selon le contexte : un faux négatif (malade déclaré sain) et un faux positif (sain déclaré malade) engagent des conséquences très différentes. Tout le choix de métrique découle de là.

from sklearn.metrics import confusion_matrix, classification_report
print(confusion_matrix(y_test, y_pred))
print(classification_report(y_test, y_pred))

Précision et rappel : les deux directions

  • Précision =VPVP+FP= \dfrac{VP}{VP + FP} : parmi les cas prédits positifs, combien le sont vraiment. « Quand le modèle dit oui, a-t-il raison ? »
  • Rappel =VPVP+FN= \dfrac{VP}{VP + FN} : parmi les vrais positifs, combien sont détectés. « Le modèle rate-t-il des cas ? »

Ce sont les deux directions du conditionnement du cours de mathématiques. Elles s'opposent via le seuil (module 3) : viser un rappel élevé sacrifie la précision, et inversement. Le choix dépend du métier :

  • Rappel prioritaire : dépistage médical, détection de fraude — rater un cas coûte cher.
  • Précision prioritaire : filtre anti-spam, recommandation — une fausse alerte agace ou nuit.

F1 : concilier les deux

Le score F1 est la moyenne harmonique de la précision et du rappel :

F1=2preˊcisionrappelpreˊcision+rappelF_1 = 2 \cdot \frac{\text{précision} \cdot \text{rappel}}{\text{précision} + \text{rappel}}

La moyenne harmonique ne récompense que si les deux sont bons : elle punit sévèrement un déséquilibre (précision de 0,95 mais rappel de 0,10 donne un F1 médiocre). C'est la métrique de référence sur les classes déséquilibrées quand on veut un seul chiffre équilibré.

L'aire sous la courbe ROC : juger indépendamment du seuil

Précision, rappel et F1 dépendent d'un seuil fixé. L'aire sous la courbe ROC (AUC-ROC) évalue le modèle à tous les seuils à la fois : elle mesure sa capacité à ordonner correctement les positifs avant les négatifs.

  • 1,0 : séparation parfaite.
  • 0,5 : pas mieux que le hasard.

L'AUC est idéale pour comparer des modèles indépendamment du seuil. Une nuance importante : sur des classes très déséquilibrées, la courbe précision-rappel (et son aire, l'AUC-PR) est souvent plus informative que l'AUC-ROC, qui peut rester flatteuse.

Choisir la métrique avant d'entraîner

La règle d'or : on choisit la métrique en fonction du problème métier, avant d'entraîner, jamais après en prenant celle qui flatte le plus. Posez la question du coût des erreurs : rater un cas ou déclencher une fausse alerte, qu'est-ce qui coûte le plus ? La réponse désigne la métrique — rappel, précision, F1 ou AUC — et c'est elle qu'on optimisera, y compris dans la validation croisée du module 8.

En résumé

  • L'exactitude trompe sur les classes déséquilibrées ; il faut regarder quelles erreurs, via la matrice de confusion.
  • Précision (quand je dis oui, ai-je raison ?) et rappel (est-ce que je rate des cas ?) s'opposent via le seuil ; le choix dépend du coût métier.
  • Le F1 concilie les deux et ne récompense que si les deux sont bons — la référence en déséquilibre.
  • L'AUC-ROC juge le modèle à tous les seuils pour comparer des modèles ; en fort déséquilibre, préférer la courbe précision-rappel. Choisir la métrique avant d'entraîner.

Module suivant : le réglage des hyperparamètres et un projet de bout en bout qui assemble tout le cours.