Aller au contenu principal

Traitement du langage naturel

Traitement automatique du langage, de la préparation du texte aux modèles préentraînés de la bibliothèque Transformers.

Durée du cours : 7h

Ce que vous allez apprendre

  • Préparer un corpus de texte proprement, y compris en français
  • Choisir une tokenisation adaptée à la langue et à la tâche
  • Utiliser des plongements de mots et de phrases
  • Affiner un modèle préentraîné sur une tâche de classification
  • Évaluer un modèle de langue au-delà de l'exactitude brute

Prérequis

  • Python et pandas
  • Fondamentaux du deep learning

Modules du cours

  1. Chaîne de traitement du texte : nettoyage et normalisation
  2. Tokenisation : mots, sous-mots, BPE, SentencePiece
  3. Sacs de mots, TF-IDF et leurs limites
  4. Word2Vec, GloVe et la géométrie du sens
  5. Plongements contextuels et modèles préentraînés
  6. Classification de texte et analyse de sentiment
  7. Reconnaissance d'entités nommées
  8. Résumé automatique et réponse aux questions
  9. La bibliothèque Transformers en pratique
  10. Projet : classificateur de documents en français

Évaluation et attestation

Le parcours se termine par un examen de 40 questions qui couvre tous les modules. En cas de réussite, une attestation d'achèvement est délivrée ; son numéro est vérifiable sur la plateforme.

Les cours gratuits, eux, se concluent par un quiz de 5 questions avec un aperçu de l'attestation, sans certification.