Affinage de modèles
Prendre un modèle ouvert de 7 à 8 milliards de paramètres et le rendre expert d'une tâche précise — ici rédiger des comptes rendus de réunion structurés à partir de transcriptions brutes — sans réentraîner un modèle depuis zéro et sans louer un centre de calcul.
Durée du cours : 8h
Ce que vous allez apprendre
- Choisir en connaissance de cause entre une consigne, RAG et l'affinage
- Préparer un jeu de données d'instructions propre, formaté selon le gabarit du modèle
- Calculer honnêtement la mémoire d'un affinage complet et savoir quand il reste justifié
- Placer LoRA et QLoRA dans la famille PEFT et comprendre ce qui est gelé
- Régler rang, alpha et modules ciblés d'un adaptateur LoRA
- Faire tenir un affinage sur un seul GPU de 24 Go grâce à la quantification en 4 bits
- Fixer taux d'apprentissage, époques, taille de lot et longueur de séquence à des valeurs raisonnables
- Lire les courbes d'entraînement et arrêter au bon moment
- Fusionner les adaptateurs, exporter au format GGUF et publier sur le Hub
- Évaluer avant et après affinage, y compris la régression sur les capacités générales
Prérequis
- Cours 16 — Grands modèles de langage
- Cours 09 — PyTorch pour le deep learning
- Python courant, notions de manipulation de tenseurs
Modules du cours
- Consigne, RAG ou affinage : choisir la bonne réponse
- Préparer un jeu de données d'instructions
- Affinage complet et son coût réel
- Affinage économe en paramètres
- LoRA : adaptateurs de rang faible
- QLoRA et quantification en 4 bits
- Hyperparamètres d'un affinage
- Suivi de l'entraînement et arrêt au bon moment
- Fusion des adaptateurs et export
- Évaluation avant et après affinage
Le fil rouge
Tous les modules s'appliquent au même cas concret : spécialiser un modèle ouvert pour transformer une transcription brute de réunion en un compte rendu structuré — décisions, points d'action, propriétaires, échéances. Le jeu de départ compte deux mille paires transcription / compte rendu, la contrainte matérielle est un seul GPU de 24 Go, et le modèle final doit s'exécuter sur un poste de travail via llama.cpp ou Ollama. Chaque module ajoute un maillon à cette chaîne, jusqu'à un modèle mesuré, exporté et déployable.
Évaluation et attestation
Le parcours se termine par un examen de 40 questions qui couvre tous les modules. En cas de réussite, une attestation d'achèvement est délivrée ; son numéro est vérifiable sur la plateforme.
Les cours gratuits, eux, se concluent par un quiz de 5 questions avec un aperçu de l'attestation, sans certification.