Récapitulatif et examen final
Dix modules pour passer d'un fichier texte brut à un classificateur d'avis clients servi en production, sur le même corpus français traité de bout en bout. Voici le cours condensé, puis les fils qui le traversent, puis l'examen.
Le cours d'un coup d'œil
| Module | L'essentiel à retenir |
|---|---|
| 1. Chaîne de traitement | Normalisation NFC systématique, NFKC seulement après audit ; ne pas retirer les mots vides pour un modèle neuronal |
| 2. Tokenisation | Sous-mots (BPE, WordPiece, SentencePiece) sont le compromis ; le français coûte 1,5 à 2× plus de jetons que l'anglais |
| 3. Sacs de mots et TF-IDF | Référence à battre en dix lignes ; trois limites structurelles (sens, ordre, contexte) motivent la suite |
| 4. Word2Vec et GloVe | Un vecteur par mot appris sur le voisinage ; les biais du corpus deviennent les biais du modèle |
| 5. Plongements contextuels | Un vecteur par occurrence ; Sentence-BERT pour la recherche sémantique, normaliser avant tout cosinus |
| 6. Classification et sentiment | Affiner à pour trois époques ; pondérer la perte, jamais sur-échantillonner |
| 7. Entités nommées | Alignement jetons contre étiquettes obligatoire ; seqeval par entité, jamais l'exactitude par jeton |
| 8. Résumé et QA | Extractif pour la fidélité, abstractif pour la fluidité ; ROUGE ne mesure ni la structure ni le sens |
| 9. Bibliothèque Transformers | Trois niveaux : pipeline, Auto* plus Trainer, sous-classement ; toujours vérifier la licence du modèle |
| 10. Projet en français | TF-IDF, Sentence-BERT, CamemBERT : coût multiplié par 24 pour 11 points de F1, arbitrage économique |
Les fils qui traversent le cours
La référence à battre n'est pas un rite, c'est une méthode. TF-IDF plus régression logistique n'est pas seulement le point de départ du module 3, c'est la métrique implicite de tous les modules suivants. Un modèle neuronal qui n'améliore pas nettement la référence n'est pas justifié, quel que soit son prestige. Sur nos avis, Sentence-BERT gagne six points, CamemBERT en gagne onze, chacun à un coût qui multiplie les euros — le choix est économique, pas technique. Cette discipline évite l'écueil le plus fréquent des projets NLP : sortir CamemBERT alors que TF-IDF suffisait, et prétendre après coup que le supplément de qualité justifie la facture.
Ce qu'on décide au module 1 se paie au module 6. Supprimer les accents, ôter les mots vides, désaccentuer, choisir un tokeniseur : chaque décision de prétraitement se propage jusqu'à la métrique finale, et l'inverse est impossible à mesurer sans réentraîner. La règle qui structure tout le cours : le prétraitement est une fonction unique, importée dans le code d'entraînement et dans le code de service, et testée sur des cas limites (accents omis, apostrophes typographiques, emojis, mots inconnus). Une divergence entre les deux prétraitements est le bogue le plus fréquent en production, et il ne lève aucune exception.
La qualité vient du corpus plus souvent que du modèle. Le module 7 le dit explicitement : doubler le support d'une classe faible bat presque tous les changements d'architecture. Le module 8 le dit autrement : dix évaluateurs humains sur cent résumés valent mille scores ROUGE. Le module 4 le dit encore : les biais du plongement ne s'enlèvent pas par la géométrie, ils s'enlèvent au corpus. À chaque fois que la métrique plafonne, la première question n'est pas « quel modèle plus gros ? » mais « quelles données manquent ? ».
La fidélité et la fluidité sont deux exigences opposées. Le module 8 les distingue, mais la tension traverse tout le cours. Un résumé abstractif est fluide et infidèle ; un résumé extractif est fidèle et laborieux. Un modèle génératif produit du texte agréable et peut inventer ; une QA extractive rend le fragment exact et peut refuser. Selon l'usage — juridique, médical, marketing, divertissement — l'un ou l'autre s'impose. Le bon système en combine souvent deux, pour rendre chaque erreur imputable.
Arbre de décision : quelle approche pour quelle tâche
| Tâche | Volume attendu | Approche recommandée | Latence typique |
|---|---|---|---|
| Classifier des avis (binaire) | < 100 k / jour | TF-IDF + LR | 1 ms |
| Classifier des avis (5 classes) | > 100 k / jour | CamemBERT affiné | 15 ms (GPU) |
| Recherche sémantique | > 10 k documents | Sentence-BERT + FAISS | 10 ms |
| Extraire des entités (produits, lieux) | tout volume | CamemBERT-NER affiné | 20 ms (GPU) |
| Résumer un dossier juridique | tout volume | Extractif (TextRank + Sentence-BERT) | 100 ms |
| Résumer une fiche marketing | tout volume | Abstractif (BARThez ou mT5) | 500 ms |
| Répondre à une question sur un document | tout volume | QA extractive (SQuAD FR affiné) | 50 ms |
| Chatbot génératif sur corpus interne | tout volume | RAG : Sentence-BERT + génératif | 1000 ms |
Cet arbre reproduit ce qu'un ingénieur NLP décide en réunion, une fois qu'il connaît les modules 1 à 10 ; l'examen valide exactement cette capacité de décision.
L'examen final
L'examen comporte 40 questions couvrant les dix modules : décision de normalisation destructrice ou conservatrice, calcul de coût en jetons selon la langue, choix entre TF-IDF et un modèle neuronal, lecture d'un biais dans un plongement, alignement jetons-étiquettes pour le NER, interprétation d'un score ROUGE trompeur, choix d'un modèle sur le Hub en fonction de la licence, arbitrage coût-latence sur un flux réel.
Plusieurs questions présentent des situations à diagnostiquer : un <UNK> massif sur les néologismes, une F1 macro qui stagne alors que l'exactitude progresse, un résumé abstractif qui invente une note qui n'existait pas dans la source, un tokeniseur multilingue qui coûte deux fois plus de jetons qu'un tokeniseur français, une base préentraînée qui perd trois points quand on la désaccentue. C'est le jugement qui est évalué, pas la mémorisation des signatures d'API.
En cas de réussite (seuil de 70 %), votre attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.
Reprenez le tableau ci-dessus et, pour chaque ligne, demandez-vous « quel symptôme verrais-je si je me trompais de méthode ici ? ». Si vous savez expliquer pourquoi retirer « pas » de la liste des mots vides est indispensable pour un modèle de sentiment, pourquoi doubler la taille du corpus annoté fait plus de gain que doubler la taille du modèle, et pourquoi ROUGE peut donner un score parfait à un résumé au sens opposé de la référence, vous êtes prêt. Bonne chance !
Examen final
Prêt à valider ce cours ?
40 questions tirées au hasard dans la banque du cours · seuil de réussite 70 % · certificat PDF vérifiable délivré immédiatement en cas de réussite.
Commencer l'examenConnexion à votre compte InSkillML et abonnement actif requis. Vous pouvez aussi lancer l'examen depuis Mes cours.