Petits modèles de langage (SLM)
Choisir, compresser et déployer un petit modèle de langage sur poste ou serveur modeste : quand il suffit, à quel coût, avec quelles garanties de confidentialité.
Durée du cours : 5h
Ce que vous allez apprendre
- Déterminer quand un modèle de 1 à 4 milliards de paramètres suffit à la tâche
- Lire une fiche de modèle et comparer les familles Phi, Llama, Mistral, Gemma, Qwen
- Distiller un grand modèle vers un petit sur un jeu de données métier
- Quantifier et élaguer sans dégrader la qualité mesurée
- Mesurer temps au premier jeton et jetons par seconde de façon reproductible
- Affiner en LoRA sur quelques centaines de tickets annotés
- Déployer localement avec Ollama ou llama.cpp et argumenter la confidentialité
Prérequis
- Notions sur les grands modèles de langage (cours 16)
- Python et un peu de ligne de commande
Fil rouge
Un assistant de classification et de résumé de tickets d'assistance exécuté sur le poste de travail d'un agent de support, sans connexion au nuage, dans la langue du front. Chaque module compare une décision technique à ses effets sur cette tâche concrète : latence, coût, qualité et confidentialité.
Modules du cours
- Pourquoi la taille n'est pas toujours la bonne réponse
- Panorama des petits modèles ouverts
- Distillation et compression de connaissances
- Élagage et quantification
- Formats d'exécution efficaces
- Mesurer la latence et le débit
- Affinage économique d'un petit modèle
- Exécution locale et hors ligne
- Confidentialité des données par l'exécution locale
- Projet : assistant spécialisé sur poste de travail
Évaluation et attestation
Le parcours se termine par un examen de 40 questions qui couvre tous les modules. En cas de réussite, une attestation d'achèvement est délivrée ; son numéro est vérifiable sur la plateforme.
Les cours gratuits, eux, se concluent par un quiz de 5 questions avec un aperçu de l'attestation, sans certification.