Aller au contenu principal

Récapitulation et examen final

Dix modules pour passer d'une intuition sur les LLM à une architecture d'assistant de support prête à mettre en service. Voici le cours condensé, les fils qui le traversent, puis les modalités de l'examen.

Le cours d'un coup d'œil

ModuleL'essentiel à retenir
1. Passage à l'échelleTrois axes — paramètres, jetons, calcul — liés par C6NDC \approx 6ND ; l'apprentissage en contexte est le vrai apport qualitatif
2. PréentraînementFiltrage et dédoublonnage pèsent autant que l'architecture ; loi de Chinchilla, environ 20 jetons par paramètre
3. Affinage instructionsModèle instruit = SFT + gabarit officiel ; qualité prime sur quantité ; LoRA rend l'affinage accessible
4. Alignement RLHF DPOLes préférences par paires expriment ce que le SFT ne peut pas ; DPO remplace largement PPO en 2026
5. DécodageTempérature, top-k, top-p règlent le tirage ; T=0T = 0 verrouille les erreurs autant que les bonnes réponses
6. Fenêtre de contextePerte au milieu et coût quadratique ; le contexte utile est bien plus court que le maximum annoncé
7. HallucinationsStructurelles ; se traitent par ancrage dans des sources et vérification par un second appel
8. Quantification et serviceAWQ et GGUF ; vLLM apporte le continuous batching ; débit et latence ne s'optimisent pas ensemble
9. ÉvaluationJeux publics contaminés, arènes biaisées, modèles-juges biaisés ; le jeu métier est la seule vraie mesure
10. Coûts et architectureCoût par requête, routage petit-grand, cache sémantique ; l'auto-hébergement gagne dès qu'il y a du volume

Les fils qui traversent le cours

Un modèle sans données extérieures ne peut pas être factuel. Cette phrase relie les modules 6, 7 et 10. Le contexte est court, la mémoire du modèle est floue et non révisable, les hallucinations sont structurelles. La seule parade solide, à toute échelle, est de fournir des sources au moment de la requête et de demander au modèle de s'y référer. Ce n'est pas une astuce d'ingénierie : c'est ce qui transforme un jouet en produit. Le cours 18 le formalisera sous le nom de génération augmentée par récupération.

Le format du modèle est appris, pas donné. Cette phrase relie les modules 3 et 4. Un modèle instruit n'est pas d'une nature différente d'un modèle de base ; il a été affiné sur quelques milliers d'exemples soigneusement écrits, puis aligné sur des paires de préférences. On peut donc, à budget maigre, refaire ce même travail sur nos propres exemples pour changer le ton, corriger un biais culturel, ancrer un vocabulaire métier. La quantité d'exemples nécessaire est étonnamment petite ; c'est la qualité qui compte.

La qualité perçue en production ne se lit pas dans les jeux de référence publics. Cette phrase relie les modules 5, 8 et 9. Un score MMLU ne prédit ni la latence, ni la robustesse, ni le comportement dans votre langue. Le décodage, la quantification, la contamination et le biais des juges déplacent les chiffres sans que les décideurs voient ce qui bouge. La seule protection est un jeu d'évaluation métier construit par vous, exécuté à chaque changement, discuté avec les opérateurs qui verront les réponses.

L'auto-hébergement est possible plus tôt qu'on ne le croit. Cette phrase relie les modules 1, 8 et 10. Un modèle ouvert de 8 milliards de 2026, quantifié en 4 bits, servi par vLLM sur une seule carte, traite plusieurs millions de requêtes par mois pour quelques centaines d'euros. La barrière d'entrée n'est plus matérielle ; elle est humaine. C'est la disponibilité d'une équipe qui sait maintenir un service GPU, pas la faisabilité technique, qui décide.

La grille de décision du fil rouge

Pour l'assistant de support francophone qui a traversé tout le cours, la synthèse tient dans un tableau que chaque équipe adaptera à ses propres contraintes.

DécisionChoix retenuModule d'origine
Type de modèleouvert, 7 à 8 milliards, licence permissive1, 10
Étape d'adaptationaffinage LoRA + DPO léger sur préférences internes3, 4
Décodagetempérature 0,3, top-p 0,9, top-k 405
Contexte4 000 jetons utiles avec résumé glissant6
Ancragerécupération sur documentation produit (à venir cours 18)6, 7
Vérificationsecond appel de contradiction sur cas sensibles7
Format serviAWQ 4 bits, vLLM avec API compatible OpenAI8
Évaluationjeu métier de 200 cas, exécution à chaque pull request9
Optimisationsroutage petit-grand, cache sémantique à 0,9210

Cette configuration n'est pas la seule possible. C'est celle que dix modules argumentent, avec les chiffres pour convaincre.

L'examen final

L'examen comporte 40 questions couvrant les dix modules : rapport entre paramètres et jetons, lois d'échelle et corpus, différence entre modèle de base et modèle instruit, mécanique de RLHF et de DPO, effet exact d'une baisse de température, phénomène de perte au milieu, cause structurelle des hallucinations, mémoire nécessaire à un modèle quantifié, contamination des jeux de référence, calcul du coût par requête.

Plusieurs questions présentent des situations à diagnostiquer : un affinage qui empire les résultats, un contexte long qui répond moins bien, un service qui sature à la première charge, un score MMLU qui ne se retrouve pas en production, un modèle qui refuse trop. C'est le jugement qui est évalué, pas la mémorisation des chiffres et des noms de méthodes.

En cas de réussite, votre attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.

Avant de commencer

Reprenez le tableau du cours d'un coup d'œil et, pour chaque ligne, demandez-vous « pourquoi ce chiffre change-t-il quelque chose ? ». Si vous savez expliquer pourquoi une température à zéro n'améliore pas la factualité, pourquoi un affinage n'ajoute presque pas de connaissances, et pourquoi un cache sémantique à seuil trop bas est dangereux, vous êtes prêt. Bonne chance !

Examen final

Prêt à valider ce cours ?

40 questions tirées au hasard dans la banque du cours · seuil de réussite 70 % · certificat PDF vérifiable délivré immédiatement en cas de réussite.

Commencer l'examen

Connexion à votre compte InSkillML et abonnement actif requis. Vous pouvez aussi lancer l'examen depuis Mes cours.