Aller au contenu principal

Récapitulatif et examen final

Dix modules pour passer d'un fichier texte brut à un classificateur d'avis clients servi en production, sur le même corpus français traité de bout en bout. Voici le cours condensé, puis les fils qui le traversent, puis l'examen.

Le cours d'un coup d'œil

ModuleL'essentiel à retenir
1. Chaîne de traitementNormalisation NFC systématique, NFKC seulement après audit ; ne pas retirer les mots vides pour un modèle neuronal
2. TokenisationSous-mots (BPE, WordPiece, SentencePiece) sont le compromis ; le français coûte 1,5 à 2× plus de jetons que l'anglais
3. Sacs de mots et TF-IDFRéférence à battre en dix lignes ; trois limites structurelles (sens, ordre, contexte) motivent la suite
4. Word2Vec et GloVeUn vecteur par mot appris sur le voisinage ; les biais du corpus deviennent les biais du modèle
5. Plongements contextuelsUn vecteur par occurrence ; Sentence-BERT pour la recherche sémantique, normaliser avant tout cosinus
6. Classification et sentimentAffiner à 2×1052 \times 10^{-5} pour trois époques ; pondérer la perte, jamais sur-échantillonner
7. Entités nomméesAlignement jetons contre étiquettes obligatoire ; seqeval par entité, jamais l'exactitude par jeton
8. Résumé et QAExtractif pour la fidélité, abstractif pour la fluidité ; ROUGE ne mesure ni la structure ni le sens
9. Bibliothèque TransformersTrois niveaux : pipeline, Auto* plus Trainer, sous-classement ; toujours vérifier la licence du modèle
10. Projet en françaisTF-IDF, Sentence-BERT, CamemBERT : coût multiplié par 24 pour 11 points de F1, arbitrage économique

Les fils qui traversent le cours

La référence à battre n'est pas un rite, c'est une méthode. TF-IDF plus régression logistique n'est pas seulement le point de départ du module 3, c'est la métrique implicite de tous les modules suivants. Un modèle neuronal qui n'améliore pas nettement la référence n'est pas justifié, quel que soit son prestige. Sur nos avis, Sentence-BERT gagne six points, CamemBERT en gagne onze, chacun à un coût qui multiplie les euros — le choix est économique, pas technique. Cette discipline évite l'écueil le plus fréquent des projets NLP : sortir CamemBERT alors que TF-IDF suffisait, et prétendre après coup que le supplément de qualité justifie la facture.

Ce qu'on décide au module 1 se paie au module 6. Supprimer les accents, ôter les mots vides, désaccentuer, choisir un tokeniseur : chaque décision de prétraitement se propage jusqu'à la métrique finale, et l'inverse est impossible à mesurer sans réentraîner. La règle qui structure tout le cours : le prétraitement est une fonction unique, importée dans le code d'entraînement et dans le code de service, et testée sur des cas limites (accents omis, apostrophes typographiques, emojis, mots inconnus). Une divergence entre les deux prétraitements est le bogue le plus fréquent en production, et il ne lève aucune exception.

La qualité vient du corpus plus souvent que du modèle. Le module 7 le dit explicitement : doubler le support d'une classe faible bat presque tous les changements d'architecture. Le module 8 le dit autrement : dix évaluateurs humains sur cent résumés valent mille scores ROUGE. Le module 4 le dit encore : les biais du plongement ne s'enlèvent pas par la géométrie, ils s'enlèvent au corpus. À chaque fois que la métrique plafonne, la première question n'est pas « quel modèle plus gros ? » mais « quelles données manquent ? ».

La fidélité et la fluidité sont deux exigences opposées. Le module 8 les distingue, mais la tension traverse tout le cours. Un résumé abstractif est fluide et infidèle ; un résumé extractif est fidèle et laborieux. Un modèle génératif produit du texte agréable et peut inventer ; une QA extractive rend le fragment exact et peut refuser. Selon l'usage — juridique, médical, marketing, divertissement — l'un ou l'autre s'impose. Le bon système en combine souvent deux, pour rendre chaque erreur imputable.

Arbre de décision : quelle approche pour quelle tâche

TâcheVolume attenduApproche recommandéeLatence typique
Classifier des avis (binaire)< 100 k / jourTF-IDF + LR1 ms
Classifier des avis (5 classes)> 100 k / jourCamemBERT affiné15 ms (GPU)
Recherche sémantique> 10 k documentsSentence-BERT + FAISS10 ms
Extraire des entités (produits, lieux)tout volumeCamemBERT-NER affiné20 ms (GPU)
Résumer un dossier juridiquetout volumeExtractif (TextRank + Sentence-BERT)100 ms
Résumer une fiche marketingtout volumeAbstractif (BARThez ou mT5)500 ms
Répondre à une question sur un documenttout volumeQA extractive (SQuAD FR affiné)50 ms
Chatbot génératif sur corpus internetout volumeRAG : Sentence-BERT + génératif1000 ms

Cet arbre reproduit ce qu'un ingénieur NLP décide en réunion, une fois qu'il connaît les modules 1 à 10 ; l'examen valide exactement cette capacité de décision.

L'examen final

L'examen comporte 40 questions couvrant les dix modules : décision de normalisation destructrice ou conservatrice, calcul de coût en jetons selon la langue, choix entre TF-IDF et un modèle neuronal, lecture d'un biais dans un plongement, alignement jetons-étiquettes pour le NER, interprétation d'un score ROUGE trompeur, choix d'un modèle sur le Hub en fonction de la licence, arbitrage coût-latence sur un flux réel.

Plusieurs questions présentent des situations à diagnostiquer : un <UNK> massif sur les néologismes, une F1 macro qui stagne alors que l'exactitude progresse, un résumé abstractif qui invente une note qui n'existait pas dans la source, un tokeniseur multilingue qui coûte deux fois plus de jetons qu'un tokeniseur français, une base préentraînée qui perd trois points quand on la désaccentue. C'est le jugement qui est évalué, pas la mémorisation des signatures d'API.

En cas de réussite (seuil de 70 %), votre attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.

Avant de commencer

Reprenez le tableau ci-dessus et, pour chaque ligne, demandez-vous « quel symptôme verrais-je si je me trompais de méthode ici ? ». Si vous savez expliquer pourquoi retirer « pas » de la liste des mots vides est indispensable pour un modèle de sentiment, pourquoi doubler la taille du corpus annoté fait plus de gain que doubler la taille du modèle, et pourquoi ROUGE peut donner un score parfait à un résumé au sens opposé de la référence, vous êtes prêt. Bonne chance !

Examen final

Prêt à valider ce cours ?

40 questions tirées au hasard dans la banque du cours · seuil de réussite 70 % · certificat PDF vérifiable délivré immédiatement en cas de réussite.

Commencer l'examen

Connexion à votre compte InSkillML et abonnement actif requis. Vous pouvez aussi lancer l'examen depuis Mes cours.