Aller au contenu principal

Récapitulation et examen final

Dix modules pour spécialiser un modèle ouvert de 7 milliards de paramètres sur une tâche métier, sans centre de calcul et sans se raconter d'histoire. Voici le cours condensé, puis les fils qui le traversent.

Le cours d'un coup d'œil

ModuleL'essentiel à retenir
1. Consigne, RAG ou affinageOn affine pour un style et un format, on ancre pour un fait ; l'ordre d'attaque est consigne, puis RAG, puis affinage
2. Jeu de données d'instructionsFormat conversationnel avec gabarit du modèle cible ; qualité, diversité, longueur ; dédoublonnage et découpage par identifiant
3. Affinage complet et son coûtEnviron 100 Go pour 7 milliards en bfloat16 avec Adam ; oubli catastrophique mécanique ; rarement justifié
4. PEFTGeler la bibliothèque et ne modifier qu'un mince ensemble ; adaptateurs, ajustement de consigne, LoRA en famille
5. LoRADécomposition BAB \cdot A de rang rr ; α=2r\alpha = 2r ; cibler l'attention ; un modèle, plusieurs adaptateurs
6. QLoRAFormat NF4, double quantification, optimiseur paginé ; un modèle de 7 milliards sur un GPU de 24 Go
7. HyperparamètresTaux d'apprentissage 2×1042 \times 10^{-4} pour QLoRA, 1 à 5 époques, lot effectif 16, séquence sur le 90e centile
8. Suivi et arrêtDeux courbes côte à côte, échantillons générés par époque, arrêt anticipé avec patience
9. Fusion et exportFusionner en bfloat16 (jamais 4 bits), exporter en GGUF pour Ollama, vérifier la licence du modèle de base
10. ÉvaluationTrois familles de métriques ; jugement humain en aveugle ; toujours mesurer la régression sur les capacités générales

Les fils qui traversent le cours

Tout revient à la question « ce que l'affinage apprend, ce qu'il n'apprend pas ». Le module 1 pose la règle — style et format, oui ; faits particuliers, non — et tous les autres modules la déclinent. Le format conversationnel du module 2 est le format que le modèle imitera, le rang rr du module 5 borne la capacité qu'il aura d'assimiler ce style, l'évaluation du module 10 vérifie que la spécialisation ne s'est pas payée d'un oubli des capacités générales. Comprendre cette règle, c'est cesser d'affiner pour de mauvaises raisons.

Le coût mémoire est la contrainte silencieuse qui structure toute la chaîne. Les 100 gigaoctets de l'affinage complet (module 3) rendent PEFT nécessaire (module 4), LoRA rend l'entraînement praticable (module 5), QLoRA le fait tenir sur un GPU grand public (module 6). Chaque module abaisse l'ordre de grandeur du suivant. Cette compréhension change la vue qu'on a des choix : QLoRA n'est pas une astuce parmi d'autres, c'est ce qui permet à toute personne disposant d'un RTX 4090 de spécialiser un modèle qui aurait exigé un centre de calcul cinq ans plus tôt.

La mesure prime sur la croyance. Un affinage sans jeu de test tenu à l'écart, sans évaluation humaine en aveugle, sans mesure de régression sur les capacités générales, n'est pas un affinage — c'est un pari. Les modules 8 et 10 sont les plus fastidieux à mettre en place, ce sont ceux qui distinguent un affinage professionnel d'un affinage amateur. Le tableau final du module 10 doit toujours contenir la ligne « ce que le modèle a perdu au passage ».

Un modèle affiné n'est jamais complètement à vous. La licence du modèle de base et celle du jeu d'affinage voyagent avec les poids et déterminent ce que vous pouvez en faire (module 9). Un affinage lancé sans avoir clarifié ces deux questions produit un actif juridiquement fragile.

Une liste de contrôle avant de lancer un affinage

Cinq questions à trancher avant la première ligne de code. Un « non » à l'une d'entre elles renvoie généralement à un autre outil que l'affinage.

  1. Ai-je essayé sérieusement une consigne bien écrite avec deux ou trois exemples ?
  2. La tâche porte-t-elle sur un style ou un format répétable, pas sur des faits changeants ?
  3. Dispose-je d'au moins quelques centaines d'exemples de qualité homogènes ?
  4. La licence du modèle de base envisagé permet-elle mon usage prévu ?
  5. Ai-je prévu un jeu de test tenu à l'écart et une évaluation en aveugle ?

Cinq « oui » : lancez. Un « non » : reprenez à la question qui a bloqué.

L'examen final

L'examen comporte 40 questions couvrant les dix modules : diagnostic d'un cas où affiner est une mauvaise idée, préparation d'un jeu d'instructions et détection de la contamination train/test, calcul de la mémoire d'un affinage complet ou en PEFT, choix de rr et de α\alpha pour LoRA, configuration de QLoRA sur un GPU donné, choix du taux d'apprentissage et diagnostic d'une divergence, lecture de courbes d'entraînement et arrêt anticipé, fusion et export vers GGUF, mesure de la régression sur les capacités générales.

Plusieurs questions présentent des situations à diagnostiquer : une perte de validation qui remonte après trois cents pas, un modèle qui casse son format une fois sur vingt, un affinage QLoRA fusionné en 4 bits qui a perdu deux points de qualité, une équipe qui veut « affiner pour connaître les procédures internes ». C'est le jugement qui est évalué, pas la récitation de valeurs par défaut.

En cas de réussite, votre attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.

Avant de commencer

Reprenez le tableau ci-dessus et, pour chaque ligne, demandez-vous « comment reconnaîtrais-je que je fais l'erreur ici ? ». Si vous savez expliquer pourquoi affiner un modèle sur des notes de service est une mauvaise idée, pourquoi r=32r = 32 avec α=16\alpha = 16 produit un adaptateur volontairement discret, et pourquoi un modèle affiné qui bat sa validation ne bat pas forcément un test tenu à l'écart, vous êtes prêt. Bonne chance !

Examen final

Prêt à valider ce cours ?

40 questions tirées au hasard dans la banque du cours · seuil de réussite 70 % · certificat PDF vérifiable délivré immédiatement en cas de réussite.

Commencer l'examen

Connexion à votre compte InSkillML et abonnement actif requis. Vous pouvez aussi lancer l'examen depuis Mes cours.