Traitement du langage naturel
Traitement automatique du langage, de la préparation du texte aux modèles préentraînés de la bibliothèque Transformers.
Durée du cours : 7h
Ce que vous allez apprendre
- Préparer un corpus de texte proprement, y compris en français
- Choisir une tokenisation adaptée à la langue et à la tâche
- Utiliser des plongements de mots et de phrases
- Affiner un modèle préentraîné sur une tâche de classification
- Évaluer un modèle de langue au-delà de l'exactitude brute
Prérequis
- Python et pandas
- Fondamentaux du deep learning
Modules du cours
- Chaîne de traitement du texte : nettoyage et normalisation
- Tokenisation : mots, sous-mots, BPE, SentencePiece
- Sacs de mots, TF-IDF et leurs limites
- Word2Vec, GloVe et la géométrie du sens
- Plongements contextuels et modèles préentraînés
- Classification de texte et analyse de sentiment
- Reconnaissance d'entités nommées
- Résumé automatique et réponse aux questions
- La bibliothèque Transformers en pratique
- Projet : classificateur de documents en français
Évaluation et attestation
Le parcours se termine par un examen de 40 questions qui couvre tous les modules. En cas de réussite, une attestation d'achèvement est délivrée ; son numéro est vérifiable sur la plateforme.
Les cours gratuits, eux, se concluent par un quiz de 5 questions avec un aperçu de l'attestation, sans certification.