Aller au contenu principal

Récapitulation et examen final

Dix modules, une seule conviction : la performance se gagne dans les variables. Voici le cours condensé — module par module d'abord, puis à travers les fils qui le traversent.

Le cours d'un coup d'œil

ModuleL'essentiel à retenir
1. Variables ou algorithmeUne variable est une représentation ; le modèle n'apprend que ce que l'espace rend exprimable
2. Valeurs manquantesDemander pourquoi ça manque (MCAR, MAR, MNAR) avant comment remplir ; l'indicateur de manque garde le signal
3. Mise à l'échelleNécessaire pour distances, produits scalaires, gradient ; inutile pour les arbres ; ne corrige pas la forme
4. Encodage catégorielNuméroter crée un faux ordre ; one-hot en faible cardinalité, cible avec lissage au-delà
5. Dates et cyclesDécomposer une date en dix variables ; sinus-cosinus pour rapprocher décembre et janvier
6. Variables de texteTF-IDF par défaut, n-grammes pour l'ordre ; ne pas négliger longueur et ponctuation
7. Agrégations et fenêtresL'écart au comportement habituel bat la valeur brute ; shift(1) avant rolling
8. Fuite de donnéesAméliore le score, donc invisible aux métriques ; quatre familles, un seul test à se poser
9. SélectionFiltres pour dégrossir, permutation pour trancher ; le coût d'exploitation compte
10. Chaînes de traitementUn Pipeline rend la fuite structurellement impossible et supprime l'écart avec la production

Les fils qui traversent tout le cours

Ajuster sur l'entraînement, appliquer partout. La même phrase revient aux modules 2, 3, 4, 6 et 10. Toute statistique apprise — médiane, moyenne, écart-type, moyennes par catégorie, vocabulaire, poids IDF — se calcule sur les données d'entraînement seules. Ce n'est pas une précaution parmi d'autres : c'est la frontière entre un score réel et un score inventé.

La question de la disponibilité, posée à chaque variable. « Cette information est-elle déjà connue au moment où je dois prédire ? » Elle vient du cours supervisé, structure le module 8, et sanctionne les variables temporelles du module 5 comme les agrégations du module 7. Une variable très prédictive et indisponible en production n'est pas un atout : c'est une fuite.

Rapporter une valeur à sa référence pertinente. C'est le mécanisme qui produit le plus de gains : un montant comparé à l'habitude du client (module 7), une catégorie remplacée par son taux de conversion (module 4), une valeur standardisée par groupe plutôt que sur la population. La valeur brute dit rarement autant que l'écart.

Le choix de la transformation dépend du modèle visé. Mise à l'échelle inutile pour les arbres mais indispensable pour l'ACP et les modèles régularisés ; encodage cyclique précieux pour un modèle linéaire, marginal pour un arbre ; haute cardinalité gérée nativement par LightGBM. Il n'y a pas de prétraitement universel, seulement des prétraitements adaptés.

L'examen final

L'examen comporte 40 questions couvrant les dix modules : mécanismes de manque et stratégies d'imputation, choix de mise à l'échelle et transformations de distribution, encodage selon la cardinalité, variables temporelles et cycliques, représentations de texte, agrégations et fenêtres, identification de fuites, méthodes de sélection et construction de chaînes de traitement.

Plusieurs questions présentent des mini-situations : une variable suspecte dont il faut dire si elle fuit, un jeu de données dont il faut choisir l'encodage, un score anormalement élevé dont il faut trouver l'origine. L'objectif du cours est le jugement, non la récitation.

En cas de réussite, votre attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.

Avant de commencer

Relisez le tableau ci-dessus, puis posez-vous pour chaque ligne la question : « et si je me trompais ici, comment le verrais-je ? ». Si la réponse vient — pourquoi une imputation par la moyenne biaise en MNAR, pourquoi un rolling sans shift détruit un modèle temporel, pourquoi un excellent score doit inquiéter — vous êtes prêt. Bonne chance !

Examen final

Prêt à valider ce cours ?

40 questions tirées au hasard dans la banque du cours · seuil de réussite 70 % · certificat PDF vérifiable délivré immédiatement en cas de réussite.

Commencer l'examen

Connexion à votre compte InSkillML et abonnement actif requis. Vous pouvez aussi lancer l'examen depuis Mes cours.