Récapitulation et examen final
Dix modules pour passer de la définition d'un modèle génératif à un pipeline complet de génération d'images conditionnées par texte, avec ses métriques et ses garde-fous juridiques. Voici le cours condensé, puis les fils qui le traversent.
Le cours d'un coup d'œil
| Module | L'essentiel à retenir |
|---|---|
| 1. Discriminatif contre génératif | classe, produit ; vraisemblance et qualité perçue ne coïncident pas |
| 2. Autoencodeurs | Représentation utile, génération médiocre : l'espace latent n'est pas régularisé |
| 3. Autoencodeurs variationnels | Reparamétrisation , KL vers , flou structurel |
| 4. GAN | Jeu minimax, .detach() obligatoire, perte non saturante ; les courbes de pertes ne racontent rien |
| 5. Mode collapse | Wasserstein plus pénalité de gradient, normalisation spectrale, jamais BatchNorm dans le critique WGAN-GP |
| 6. Diffusion | MSE sur le bruit prédit, U-Net conditionné par , DDIM 20-50 pas, diffusion latente pour le passage à l'échelle |
| 7. Conditionnement texte | CLIP plus attention croisée, guidage sans classificateur , negative_prompt est du CFG |
| 8. Métriques | FID sur 50 000 images, précision-rappel séparent qualité et diversité, humain irremplaçable |
| 9. Texte, image, audio | Texte autorégressif structurel, image diffusion latente, audio mixte selon le sous-domaine |
| 10. Droits et provenance | AI Act, filigrane et C2PA complémentaires, hypertrucages, prévoir la conformité à la conception |
Les fils qui traversent le cours
La vraisemblance n'est pas la qualité perçue. Le VAE gagne en vraisemblance et perd en netteté ; le GAN gagne en netteté et perd en couverture ; la diffusion arbitre différemment. Chaque famille a inventé une astuce pour contourner la limite précédente — reparamétrisation, jeu à deux joueurs, débruitage itératif — mais aucune ne domine sur tous les axes. Le module 8 rend cette tension mesurable : deux modèles au même FID peuvent avoir des précisions et des rappels opposés. Choisir une famille génératrice, c'est arbitrer explicitement ce compromis.
L'entraînement stable et l'échantillonnage rapide ne vont pas ensemble. Le GAN s'entraîne difficilement mais s'échantillonne en une passe. La diffusion s'entraîne comme une MSE stable et s'échantillonne en dix à mille passes. Tous les développements récents (DDIM, DPM-Solver, distillation en modèles à peu de pas, SDXL Turbo) cherchent à récupérer la vitesse d'échantillonnage d'un GAN tout en gardant la stabilité d'entraînement d'une diffusion. C'est le vrai front de recherche moderne.
Le conditionnement change la nature du problème. Un modèle inconditionnel produit des chats plausibles ; un modèle conditionné doit produire le chat demandé. L'attention croisée est le pont technique, le guidage sans classificateur est le levier qui règle l'obéissance à la consigne. À échelle trop faible, le modèle ignore le texte ; trop élevée, il sursature. Aucune consigne « moyenne » n'existe : chaque déploiement calibre son selon le public visé.
Ce qui manque à un modèle génératif se paie ailleurs. Un GAN sans pénalité de gradient s'effondre. Un VAE sans terme KL redevient un autoencodeur. Une diffusion sans conditionnement de pas produit du bruit à tous les niveaux. Un modèle sans filigrane, sans documentation des données, sans mécanisme de retrait, se paie au tribunal. Les cinq années 2020-2025 ont montré que la fragilité juridique est aussi structurelle que la fragilité mathématique : les deux se prévoient à la conception, pas après.
L'examen final
L'examen comporte 40 questions couvrant les dix modules : distinction entre modélisation de et de , écriture de l'ELBO et rôle exact de la reparamétrisation, diagnostic des symptômes d'un GAN qui décroche, choix entre BCE, Wasserstein-GP et normalisation spectrale, prédiction du bruit contre prédiction de en diffusion, conditionnement par CLIP et attention croisée, réglage de l'échelle de guidage, interprétation d'un FID trompeur avec précision-rappel, choix de famille selon la modalité, et obligations juridiques du déploiement.
Plusieurs questions présentent des situations à diagnostiquer : une perte de discriminateur qui s'effondre en dix époques, des images générées qui se répètent, un -VAE qui rend la même image moyenne, une perte de diffusion qui reste haute, un pipeline texte-image qui ignore les mots précis de la consigne, un FID stable pendant qu'un modèle sacrifie sa diversité, une génération de personnes identifiables sans consentement. C'est le jugement qui est évalué, pas la récitation d'équations.
En cas de réussite, votre attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.
Reprenez le tableau ci-dessus et, pour chaque ligne, demandez-vous « quel symptôme verrais-je si je me trompais ici ? ». Si vous savez expliquer pourquoi la KL peut collapser à zéro, pourquoi la BatchNorm casse la pénalité de gradient, et pourquoi un FID plus bas ne veut pas dire « meilleur pour votre usage », vous êtes prêt. Bonne chance !
Examen final
Prêt à valider ce cours ?
40 questions tirées au hasard dans la banque du cours · seuil de réussite 70 % · certificat PDF vérifiable délivré immédiatement en cas de réussite.
Commencer l'examenConnexion à votre compte InSkillML et abonnement actif requis. Vous pouvez aussi lancer l'examen depuis Mes cours.