Aller au contenu principal

Traitement du langage naturel

Ce cours enseigne le traitement automatique du langage naturel appliqué au français, du premier octet reçu jusqu'à un classificateur d'avis clients servi en production. Chaque module ancre ses concepts dans le même corpus, pour que la théorie ne se dilue jamais en abstractions.

Durée du cours : 7 h

Le fil rouge du cours

Un même corpus traverse les dix modules : environ dix mille avis clients rédigés en français, notés de une à cinq étoiles, collectés sur des plateformes d'hébergement, de restauration et de commerce en ligne. Ce corpus sert successivement d'exemple de nettoyage (module 1), de terrain pour comparer les stratégies de tokenisation (module 2), de banc d'essai pour une régression logistique de référence (module 3), puis pour des plongements de mots et de phrases (modules 4 et 5), pour un classificateur affiné (module 6), pour l'extraction d'entités produits (module 7), enfin pour un résumé automatique et une réponse à des questions (module 8).

À chaque étape, on compare le résultat à celui du module précédent, sur le même jeu de test. Ce protocole rend visible ce que chaque approche apporte et ce qu'elle coûte.

Ce que vous allez apprendre

  • Normaliser le texte français (Unicode, casse, ponctuation, élision, accents) sans détruire l'information utile
  • Choisir une stratégie de tokenisation adaptée à la langue et au modèle cible
  • Construire une référence TF-IDF plus logistique en dix lignes, et savoir quand elle suffit
  • Utiliser des plongements de mots puis contextuels pour la recherche sémantique
  • Affiner un encodeur préentraîné pour la classification et la reconnaissance d'entités nommées
  • Manipuler la bibliothèque Transformers de bout en bout, du pipeline à Trainer
  • Livrer un classificateur d'avis avec métriques honnêtes, coût et latence

Prérequis

  • Python courant (cours 02) : listes, boucles, fonctions, gestion des exceptions
  • Apprentissage supervisé (cours 04) : partition en jeux d'entraînement et de test, métriques de classification, matrice de confusion
  • Notions sur les Transformers (cours 12) : recommandé, pas obligatoire

Modules du cours

  1. Chaîne de traitement du texte : nettoyage et normalisation
  2. Tokenisation : mots, sous-mots, BPE, SentencePiece
  3. Sacs de mots, TF-IDF et leurs limites
  4. Word2Vec, GloVe et la géométrie du sens
  5. Plongements contextuels et modèles préentraînés
  6. Classification de texte et analyse de sentiment
  7. Reconnaissance d'entités nommées
  8. Résumé automatique et réponse aux questions
  9. La bibliothèque Transformers en pratique
  10. Projet : classificateur de documents en français

Évaluation et attestation

Le parcours se termine par un examen de 40 questions qui couvre les dix modules. En cas de réussite (seuil de 70 %), une attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.

Les cours gratuits, eux, se concluent par un quiz de cinq questions avec un aperçu de l'attestation, sans certification.