Récapitulation et examen final
Dix modules, une seule conviction : la performance se gagne dans les variables. Voici le cours condensé — module par module d'abord, puis à travers les fils qui le traversent.
Le cours d'un coup d'œil
| Module | L'essentiel à retenir |
|---|---|
| 1. Variables ou algorithme | Une variable est une représentation ; le modèle n'apprend que ce que l'espace rend exprimable |
| 2. Valeurs manquantes | Demander pourquoi ça manque (MCAR, MAR, MNAR) avant comment remplir ; l'indicateur de manque garde le signal |
| 3. Mise à l'échelle | Nécessaire pour distances, produits scalaires, gradient ; inutile pour les arbres ; ne corrige pas la forme |
| 4. Encodage catégoriel | Numéroter crée un faux ordre ; one-hot en faible cardinalité, cible avec lissage au-delà |
| 5. Dates et cycles | Décomposer une date en dix variables ; sinus-cosinus pour rapprocher décembre et janvier |
| 6. Variables de texte | TF-IDF par défaut, n-grammes pour l'ordre ; ne pas négliger longueur et ponctuation |
| 7. Agrégations et fenêtres | L'écart au comportement habituel bat la valeur brute ; shift(1) avant rolling |
| 8. Fuite de données | Améliore le score, donc invisible aux métriques ; quatre familles, un seul test à se poser |
| 9. Sélection | Filtres pour dégrossir, permutation pour trancher ; le coût d'exploitation compte |
| 10. Chaînes de traitement | Un Pipeline rend la fuite structurellement impossible et supprime l'écart avec la production |
Les fils qui traversent tout le cours
Ajuster sur l'entraînement, appliquer partout. La même phrase revient aux modules 2, 3, 4, 6 et 10. Toute statistique apprise — médiane, moyenne, écart-type, moyennes par catégorie, vocabulaire, poids IDF — se calcule sur les données d'entraînement seules. Ce n'est pas une précaution parmi d'autres : c'est la frontière entre un score réel et un score inventé.
La question de la disponibilité, posée à chaque variable. « Cette information est-elle déjà connue au moment où je dois prédire ? » Elle vient du cours supervisé, structure le module 8, et sanctionne les variables temporelles du module 5 comme les agrégations du module 7. Une variable très prédictive et indisponible en production n'est pas un atout : c'est une fuite.
Rapporter une valeur à sa référence pertinente. C'est le mécanisme qui produit le plus de gains : un montant comparé à l'habitude du client (module 7), une catégorie remplacée par son taux de conversion (module 4), une valeur standardisée par groupe plutôt que sur la population. La valeur brute dit rarement autant que l'écart.
Le choix de la transformation dépend du modèle visé. Mise à l'échelle inutile pour les arbres mais indispensable pour l'ACP et les modèles régularisés ; encodage cyclique précieux pour un modèle linéaire, marginal pour un arbre ; haute cardinalité gérée nativement par LightGBM. Il n'y a pas de prétraitement universel, seulement des prétraitements adaptés.
L'examen final
L'examen comporte 40 questions couvrant les dix modules : mécanismes de manque et stratégies d'imputation, choix de mise à l'échelle et transformations de distribution, encodage selon la cardinalité, variables temporelles et cycliques, représentations de texte, agrégations et fenêtres, identification de fuites, méthodes de sélection et construction de chaînes de traitement.
Plusieurs questions présentent des mini-situations : une variable suspecte dont il faut dire si elle fuit, un jeu de données dont il faut choisir l'encodage, un score anormalement élevé dont il faut trouver l'origine. L'objectif du cours est le jugement, non la récitation.
En cas de réussite, votre attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.
Relisez le tableau ci-dessus, puis posez-vous pour chaque ligne la question : « et si je me trompais ici, comment le verrais-je ? ». Si la réponse vient — pourquoi une imputation par la moyenne biaise en MNAR, pourquoi un rolling sans shift détruit un modèle temporel, pourquoi un excellent score doit inquiéter — vous êtes prêt. Bonne chance !
Examen final
Prêt à valider ce cours ?
40 questions tirées au hasard dans la banque du cours · seuil de réussite 70 % · certificat PDF vérifiable délivré immédiatement en cas de réussite.
Commencer l'examenConnexion à votre compte InSkillML et abonnement actif requis. Vous pouvez aussi lancer l'examen depuis Mes cours.