Récapitulation et examen final
Dix modules pour passer d'une intuition sur les LLM à une architecture d'assistant de support prête à mettre en service. Voici le cours condensé, les fils qui le traversent, puis les modalités de l'examen.
Le cours d'un coup d'œil
| Module | L'essentiel à retenir |
|---|---|
| 1. Passage à l'échelle | Trois axes — paramètres, jetons, calcul — liés par ; l'apprentissage en contexte est le vrai apport qualitatif |
| 2. Préentraînement | Filtrage et dédoublonnage pèsent autant que l'architecture ; loi de Chinchilla, environ 20 jetons par paramètre |
| 3. Affinage instructions | Modèle instruit = SFT + gabarit officiel ; qualité prime sur quantité ; LoRA rend l'affinage accessible |
| 4. Alignement RLHF DPO | Les préférences par paires expriment ce que le SFT ne peut pas ; DPO remplace largement PPO en 2026 |
| 5. Décodage | Température, top-k, top-p règlent le tirage ; verrouille les erreurs autant que les bonnes réponses |
| 6. Fenêtre de contexte | Perte au milieu et coût quadratique ; le contexte utile est bien plus court que le maximum annoncé |
| 7. Hallucinations | Structurelles ; se traitent par ancrage dans des sources et vérification par un second appel |
| 8. Quantification et service | AWQ et GGUF ; vLLM apporte le continuous batching ; débit et latence ne s'optimisent pas ensemble |
| 9. Évaluation | Jeux publics contaminés, arènes biaisées, modèles-juges biaisés ; le jeu métier est la seule vraie mesure |
| 10. Coûts et architecture | Coût par requête, routage petit-grand, cache sémantique ; l'auto-hébergement gagne dès qu'il y a du volume |
Les fils qui traversent le cours
Un modèle sans données extérieures ne peut pas être factuel. Cette phrase relie les modules 6, 7 et 10. Le contexte est court, la mémoire du modèle est floue et non révisable, les hallucinations sont structurelles. La seule parade solide, à toute échelle, est de fournir des sources au moment de la requête et de demander au modèle de s'y référer. Ce n'est pas une astuce d'ingénierie : c'est ce qui transforme un jouet en produit. Le cours 18 le formalisera sous le nom de génération augmentée par récupération.
Le format du modèle est appris, pas donné. Cette phrase relie les modules 3 et 4. Un modèle instruit n'est pas d'une nature différente d'un modèle de base ; il a été affiné sur quelques milliers d'exemples soigneusement écrits, puis aligné sur des paires de préférences. On peut donc, à budget maigre, refaire ce même travail sur nos propres exemples pour changer le ton, corriger un biais culturel, ancrer un vocabulaire métier. La quantité d'exemples nécessaire est étonnamment petite ; c'est la qualité qui compte.
La qualité perçue en production ne se lit pas dans les jeux de référence publics. Cette phrase relie les modules 5, 8 et 9. Un score MMLU ne prédit ni la latence, ni la robustesse, ni le comportement dans votre langue. Le décodage, la quantification, la contamination et le biais des juges déplacent les chiffres sans que les décideurs voient ce qui bouge. La seule protection est un jeu d'évaluation métier construit par vous, exécuté à chaque changement, discuté avec les opérateurs qui verront les réponses.
L'auto-hébergement est possible plus tôt qu'on ne le croit. Cette phrase relie les modules 1, 8 et 10. Un modèle ouvert de 8 milliards de 2026, quantifié en 4 bits, servi par vLLM sur une seule carte, traite plusieurs millions de requêtes par mois pour quelques centaines d'euros. La barrière d'entrée n'est plus matérielle ; elle est humaine. C'est la disponibilité d'une équipe qui sait maintenir un service GPU, pas la faisabilité technique, qui décide.
La grille de décision du fil rouge
Pour l'assistant de support francophone qui a traversé tout le cours, la synthèse tient dans un tableau que chaque équipe adaptera à ses propres contraintes.
| Décision | Choix retenu | Module d'origine |
|---|---|---|
| Type de modèle | ouvert, 7 à 8 milliards, licence permissive | 1, 10 |
| Étape d'adaptation | affinage LoRA + DPO léger sur préférences internes | 3, 4 |
| Décodage | température 0,3, top-p 0,9, top-k 40 | 5 |
| Contexte | 4 000 jetons utiles avec résumé glissant | 6 |
| Ancrage | récupération sur documentation produit (à venir cours 18) | 6, 7 |
| Vérification | second appel de contradiction sur cas sensibles | 7 |
| Format servi | AWQ 4 bits, vLLM avec API compatible OpenAI | 8 |
| Évaluation | jeu métier de 200 cas, exécution à chaque pull request | 9 |
| Optimisations | routage petit-grand, cache sémantique à 0,92 | 10 |
Cette configuration n'est pas la seule possible. C'est celle que dix modules argumentent, avec les chiffres pour convaincre.
L'examen final
L'examen comporte 40 questions couvrant les dix modules : rapport entre paramètres et jetons, lois d'échelle et corpus, différence entre modèle de base et modèle instruit, mécanique de RLHF et de DPO, effet exact d'une baisse de température, phénomène de perte au milieu, cause structurelle des hallucinations, mémoire nécessaire à un modèle quantifié, contamination des jeux de référence, calcul du coût par requête.
Plusieurs questions présentent des situations à diagnostiquer : un affinage qui empire les résultats, un contexte long qui répond moins bien, un service qui sature à la première charge, un score MMLU qui ne se retrouve pas en production, un modèle qui refuse trop. C'est le jugement qui est évalué, pas la mémorisation des chiffres et des noms de méthodes.
En cas de réussite, votre attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.
Reprenez le tableau du cours d'un coup d'œil et, pour chaque ligne, demandez-vous « pourquoi ce chiffre change-t-il quelque chose ? ». Si vous savez expliquer pourquoi une température à zéro n'améliore pas la factualité, pourquoi un affinage n'ajoute presque pas de connaissances, et pourquoi un cache sémantique à seuil trop bas est dangereux, vous êtes prêt. Bonne chance !
Examen final
Prêt à valider ce cours ?
40 questions tirées au hasard dans la banque du cours · seuil de réussite 70 % · certificat PDF vérifiable délivré immédiatement en cas de réussite.
Commencer l'examenConnexion à votre compte InSkillML et abonnement actif requis. Vous pouvez aussi lancer l'examen depuis Mes cours.