📄️ Petits modèles de langage (SLM)
Choisir, compresser et déployer un petit modèle de langage sur poste ou serveur modeste : quand il suffit, à quel coût, avec quelles garanties de confidentialité. Examen de 40 questions et attestation vérifiable.
📄️ 1. La taille n'est pas la réponse
Module 1 du cours premium sur les petits modèles de langage : comparer un modèle de 3 milliards de paramètres à un grand modèle en API sur une tâche étroite de classification de tickets.
📄️ 2. Panorama des modèles ouverts
Module 2 du cours premium sur les petits modèles de langage : familles Phi, Gemma, Qwen, Llama, Mistral, licences, langues couvertes et lecture d'une fiche de modèle.
📄️ 3. Distillation et compression
Module 3 du cours premium sur les petits modèles de langage : distillation enseignant-élève, données synthétiques générées par un grand modèle, et transfert de compétence sur les tickets métier.
📄️ 4. Élagage et quantification
Module 4 du cours premium sur les petits modèles de langage : quantification 8 bits et 4 bits, élagage structuré et non structuré, perte de qualité mesurée sur les tickets.
📄️ 5. Formats d'exécution
Module 5 du cours premium sur les petits modèles de langage : formats GGUF pour llama.cpp, ONNX Runtime, MLX pour Apple Silicon, choix selon le matériel cible.
📄️ 6. Mesurer latence et débit
Module 6 du cours premium sur les petits modèles de langage : temps au premier jeton, jetons par seconde, taille de lot, protocole de mesure reproductible sur CPU et GPU d'entrée de gamme.
📄️ 7. Affinage économique
Module 7 du cours premium sur les petits modèles de langage : LoRA sur 1 à 4 milliards de paramètres, jeu de tickets annotés, coût en minutes GPU et gain mesuré sur la classification.
📄️ 8. Exécution locale et hors ligne
Module 8 du cours premium sur les petits modèles de langage : installation sur poste avec Ollama ou llama.cpp, mémoire nécessaire, mise à jour et intégration à l'outil de tickets.
📄️ 9. Confidentialité par le local
Module 9 du cours premium sur les petits modèles de langage : ce que l'exécution locale protège vraiment, les obligations réglementaires facilitées, et ce qu'elle ne protège pas.
📄️ 10. Projet : assistant sur poste
Module 10 du cours premium sur les petits modèles de langage : assemblage complet, évaluation contre l'API sur 200 tickets, coût total sur un an et cas à renvoyer vers un grand modèle.
📄️ Récapitulation et examen
Synthèse complète du cours premium sur les petits modèles de langage : choix, distillation, quantification, formats, latence, affinage, exécution locale, confidentialité, projet, et examen de 40 questions.