Récapitulation et examen final
Dix modules pour passer d'un choix de modèle à un assistant local évalué, chiffré, défendable devant une direction. Voici le cours condensé, puis les fils qui le traversent.
Le cours d'un coup d'œil
| Module | L'essentiel à retenir |
|---|---|
| 1. La taille n'est pas la réponse | Tâche étroite contre tâche ouverte ; petit modèle rivalise sur tâche étroite ; décision sur quatre variables : coût, latence, confidentialité, qualité |
| 2. Panorama des modèles ouverts | Phi, Llama, Mistral, Gemma, Qwen ; la licence se lit avant tout ; les benchmarks ne remplacent pas votre jeu d'évaluation |
| 3. Distillation | L'enseignant fabrique le jeu de données, l'élève apprend dessus ; sorties dures suffisent, données synthétiques multiplient la couverture |
| 4. Élagage et quantification | 4 bits AWQ ou GPTQ, 0 à 2 points perdus sur tâche étroite ; l'élagage coûte plus cher en qualité ; jamais deux transformations à la fois pour mesurer |
| 5. Formats d'exécution | GGUF pour l'universel via llama.cpp, ONNX pour l'industriel, MLX pour Apple ; toujours revalider sur les 200 tickets après conversion |
| 6. Latence et débit | TTFT et TPS séparés, 95ᵉ centile, batch 1 sur poste ; contexte long fait exploser le TTFT en quadratique |
| 7. Affinage LoRA | QLoRA sur 3B tient sur RTX 3060 12 Go ; 300-800 tickets propres valent 5 000 douteux ; rang 16, deux époques, arrêt anticipé |
| 8. Exécution locale | Ollama pour la simplicité, llama.cpp pour le contrôle ; 6 Go de RAM libres pour un 3B en 4 bits ; versionnage, canari, distribution centrale |
| 9. Confidentialité | Le local supprime la sous-traitance et le transfert hors UE, ne protège pas contre un poste mal sécurisé, un journal verbeux ou une sauvegarde qui remonte |
| 10. Projet complet | Ministral 3B affiné, Q4_K_M, Ollama, 96 % de l'API pour 1,1 s de latence ; hybride 5-10 % de renvoi vers l'API pour les cas difficiles |
Les fils qui traversent le cours
La mesure décide, pas l'idéologie. Chaque module aboutit à une décision qui repose sur les mêmes 200 tickets d'évaluation. Choisir un modèle sur un billet de blog, quantifier sans mesurer, comparer un TTFT sur H100 à un TTFT sur portable : ces trois gestes suffisent à ruiner un projet. Le protocole du module 1, réutilisé aux modules 4, 5, 6, 7 et 10, est le fil rouge technique du cours.
La compression a plusieurs étages, à appliquer dans l'ordre. Quantification d'abord (5 minutes, souvent sans perte), distillation ensuite (une journée, quelques euros), affinage en dernier (une itération, quelques euros). Cet ordre minimise le coût d'ingénierie et permet de s'arrêter dès qu'on a la qualité recherchée. Trop d'équipes commencent par l'affinage et découvrent qu'une simple quantification suffisait.
Le local n'est pas une baguette magique. Il supprime des risques identifiables, en fait apparaître d'autres, et coûte parfois plus cher que la simple facture d'une API. Un rapport de projet qui présente ces trois faces est défendable en direction. Un rapport qui vend « local = sûr » se piège au premier audit.
La grille de décision petit modèle contre grand modèle. Trois critères la construisent honnêtement. Est-ce que la tâche est étroite au sens du module 1 ? Est-ce que l'entreprise valorise, en euros ou en obligations réglementaires, l'exécution en local ? Est-ce que les 200 tickets d'évaluation montrent un écart de qualité inférieur à 2 ou 3 points en défaveur du petit modèle après affinage ? Trois oui, on part sur le petit modèle avec un routage hybride pour les 5 à 10 % de cas difficiles. Un non sur la première question, on garde le grand modèle sans hésiter.
L'examen final
L'examen comporte 40 questions couvrant les dix modules : tâche adaptée ou non au petit modèle, lecture d'une licence, mécanique de la distillation, arbitrage entre quantification et élagage, choix de format selon le matériel, protocole de mesure honnête, réglage LoRA, budget mémoire d'un déploiement, cas où le local ne protège pas malgré l'apparence, et grille de routage entre petit et grand modèle.
Plusieurs questions présentent des situations à diagnostiquer : un affinage qui plafonne, une conversion GGUF silencieusement dégradée, une comparaison de latence trompeuse, un choix de modèle qui viole une clause de licence, un journal applicatif qui trahit la démarche de confidentialité affichée. C'est le jugement qui est évalué, pas la récitation.
En cas de réussite, votre attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.
Reprenez le tableau ci-dessus et, pour chaque ligne, demandez-vous « comment mesurerais-je que je me trompe ici ? ». Si vous savez dire pourquoi la quantification vient avant la distillation, quand une tâche est étroite au sens du module 1, ce que le local ne protège pas malgré l'exécution sur poste, et pourquoi un routage hybride bat souvent l'API pure en qualité perçue, vous êtes prêt. Bonne chance !
Examen final
Prêt à valider ce cours ?
40 questions tirées au hasard dans la banque du cours · seuil de réussite 70 % · certificat PDF vérifiable délivré immédiatement en cas de réussite.
Commencer l'examenConnexion à votre compte InSkillML et abonnement actif requis. Vous pouvez aussi lancer l'examen depuis Mes cours.