Aller au contenu principal

Leçon 6 — Récapitulatif et FAQ

Les cinq leçons en une page

Leçon 1 — la difficulté. Le langage est ambigu au niveau des mots, des structures, des références, et par tout ce qu'il laisse implicite. Nous résolvons ces ambiguïtés sans savoir comment, ce qui condamne l'écriture de règles hors domaines très étroits.

Leçon 2 — la tokenisation. Le texte devient des identifiants numériques. Le découpage en sous-mots donne un vocabulaire fixe et supprime les mots inconnus. Il explique la facturation en tokens, la taille réelle des fenêtres de contexte, et le surcoût structurel du français.

Leçon 3 — les plongements. Un vecteur dense appris par la tâche prétexte de prédiction du voisinage transforme le sens en géométrie. Les plongements fixes butent sur la polysémie ; les plongements contextuels calculent un vecteur par occurrence, et c'est le saut décisif de 2018.

Leçon 4 — les tâches. Classer, extraire, transformer, générer, par fiabilité décroissante. Reformuler un besoin en classification ou en extraction est presque toujours le bon réflexe.

Leçon 5 — les limites. Faits inventés par construction, biais hérités des corpus, inégalité entre langues, chute de performance sur données réelles, scores publics surestimés.


Glossaire

TermeCe que cela veut dire
NLPtraitement automatique du langage naturel
Tokenl'unité de texte traitée par le modèle, souvent un fragment de mot
Tokenisationle découpage du texte en tokens
BPEl'algorithme qui apprend le découpage en fusionnant les paires fréquentes
Vocabulairel'ensemble fini des tokens connus du modèle
Plongementle vecteur dense représentant un token ou un texte
Similarité cosinusla mesure d'angle entre deux vecteurs, entre −1 et 1
Plongement contextuelun vecteur calculé selon la phrase, non stocké
Sac de motsla représentation par comptage, sans notion de proximité de sens
TF-IDFla pondération qui valorise les mots rares du corpus
Entité nomméeune personne, une organisation, un lieu, une date, un montant
NERla reconnaissance d'entités nommées
Résumé extractifun résumé composé de phrases prélevées dans la source
Résumé abstractifun résumé reformulé, donc capable d'inventer
Fine-tuningl'affinage d'un modèle pré-entraîné sur vos données
RAGla génération augmentée par récupération de documents
Base vectorielleun stockage de plongements interrogeable par proximité
Fenêtre de contextele nombre maximal de tokens traités en une fois
Hallucinationune affirmation inventée mais formulée avec assurance
BLEU / ROUGEdes scores de recouvrement de mots avec une référence

Les 12 questions que les gens posent vraiment

1. Combien d'exemples annotés faut-il pour affiner un classifieur ?

Pour une tâche simple à deux ou trois classes, quelques centaines d'exemples par classe donnent déjà un résultat exploitable. Pour une tâche fine à vingt classes, comptez plutôt mille à cinq mille exemples au total. La qualité de l'annotation compte davantage que la quantité : deux annotateurs qui ne sont pas d'accord entre eux produisent un plafond de performance que rien ne dépassera.

2. spaCy ou les transformeurs ?

spaCy pour une chaîne de traitement industrielle rapide : entités standard, découpage en phrases, analyse syntaxique, à très faible coût de calcul. Les transformeurs quand la précision compte plus que la vitesse, ou quand la tâche est spécifique. Les deux se combinent bien : spaCy pour le prétraitement, un transformeur pour l'étape difficile.

3. RAG ou fine-tuning ?

Ce sont deux réponses à deux problèmes différents. Le RAG apporte de la connaissance : des documents que le modèle n'a pas vus, qui changent souvent, et qu'il faut pouvoir citer. Le fine-tuning apporte du comportement : un format de sortie, un ton, une terminologie maison. Si vous voulez que le modèle connaisse vos procédures, c'est du RAG. Si vous voulez qu'il réponde toujours dans votre format, c'est du fine-tuning. Souvent, les deux.

4. Peut-on faire du NLP sans envoyer les données à l'extérieur ?

Oui, complètement. Des modèles ouverts de bonne qualité s'exécutent sur une machine que vous contrôlez, et pour la classification ou l'extraction, un modèle de quelques centaines de millions de paramètres tourne même sans carte graphique dédiée. C'est souvent la seule option acceptable sur des données de santé, juridiques ou RH.

5. Comment gérer plusieurs langues ?

Deux stratégies. Un modèle multilingue unique — la famille XLM-R, ou les grands modèles récents — simplifie l'exploitation et perd un peu de précision par langue. Un modèle par langue est plus précis et multiplie la maintenance. Pour deux ou trois langues bien dotées, le multilingue est généralement le bon compromis.

6. Comment détecter qu'un texte a été généré par une IA ?

De façon fiable, on ne sait pas faire. Les détecteurs disponibles produisent beaucoup de faux positifs, notamment sur les textes écrits par des locuteurs non natifs, dont le style plus régulier ressemble à celui des modèles. Fonder une sanction académique ou professionnelle sur un tel outil est indéfendable.

7. Pourquoi mon modèle est-il excellent en test et mauvais en production ?

Presque toujours parce que les données diffèrent. Vos données de production contiennent des fautes, des abréviations internes, du texte mal extrait, des mélanges de langues. Vérifiez aussi la fuite de données : si vous avez découpé aléatoirement un jeu contenant des doublons, des textes quasi identiques se retrouvent des deux côtés et le score est artificiel.

8. Faut-il retirer les mots vides et lemmatiser ?

Avec un sac de mots ou du TF-IDF, oui, cela aide. Avec un transformeur, non, et cela nuit : le modèle exploite les mots grammaticaux et la morphologie pour construire ses représentations contextuelles. Les recettes de prétraitement héritées des années 2000 dégradent les modèles modernes.

9. Que coûte un projet NLP en entreprise ?

Le calcul est rarement le poste principal. Ce qui coûte, c'est l'annotation — des jours d'experts métier — et l'intégration dans les systèmes existants. Une règle empirique tenable : le modèle représente environ 20 % de l'effort, les données 50 %, l'intégration et le suivi 30 %.

10. Comment évaluer honnêtement un prestataire ?

Constituez votre jeu de test à partir de vos données, gardez-le confidentiel, et demandez au prestataire de traiter ces exemples. Refusez les démonstrations sur des exemples qu'il choisit et les scores sur des jeux publics. Deux ou trois cents exemples bien annotés suffisent à départager les candidats.

11. Le NLP va-t-il remplacer les traducteurs et les rédacteurs ?

Le métier se déplace davantage qu'il ne disparaît. La traduction professionnelle est déjà largement passée à la post-édition d'une sortie automatique, ce qui change la nature du travail et sa tarification. Ce qui reste humain : les enjeux juridiques, la responsabilité éditoriale, la localisation culturelle, et tout contenu où une erreur coûte cher.

12. Où aller après ce cours ?

Grands modèles de langage pour la suite directe, IA générative pour la production de contenu, Éthique de l'IA pour les biais du langage traités sérieusement, et MLOps pour tout ce qui se passe après l'entraînement.


Prêt à construire de vraies chaînes de traitement de texte ?

Les cours premium couvrent le fine-tuning de transformeurs, le RAG, les bases vectorielles et la mise en production, avec notebooks et jeux de données réels, et un certificat vérifiable après un examen de 40 questions. Inclus dans toutes les formules payantes.


Dernière étapePassez le quiz et découvrez votre attestation →