Aller au contenu principal

Récapitulation et examen final

Dix modules pour passer de la définition d'un modèle génératif à un pipeline complet de génération d'images conditionnées par texte, avec ses métriques et ses garde-fous juridiques. Voici le cours condensé, puis les fils qui le traversent.

Le cours d'un coup d'œil

ModuleL'essentiel à retenir
1. Discriminatif contre génératifp(yx)p(y \mid x) classe, p(x)p(x) produit ; vraisemblance et qualité perçue ne coïncident pas
2. AutoencodeursReprésentation utile, génération médiocre : l'espace latent n'est pas régularisé
3. Autoencodeurs variationnelsReparamétrisation z=μ+σεz = \mu + \sigma \odot \varepsilon, KL vers N(0,I)\mathcal{N}(0, I), flou structurel
4. GANJeu minimax, .detach() obligatoire, perte non saturante ; les courbes de pertes ne racontent rien
5. Mode collapseWasserstein plus pénalité de gradient, normalisation spectrale, jamais BatchNorm dans le critique WGAN-GP
6. DiffusionMSE sur le bruit prédit, U-Net conditionné par tt, DDIM 20-50 pas, diffusion latente pour le passage à l'échelle
7. Conditionnement texteCLIP plus attention croisée, guidage sans classificateur w[3,15]w \in [3, 15], negative_prompt est du CFG
8. MétriquesFID sur 50 000 images, précision-rappel séparent qualité et diversité, humain irremplaçable
9. Texte, image, audioTexte autorégressif structurel, image diffusion latente, audio mixte selon le sous-domaine
10. Droits et provenanceAI Act, filigrane et C2PA complémentaires, hypertrucages, prévoir la conformité à la conception

Les fils qui traversent le cours

La vraisemblance n'est pas la qualité perçue. Le VAE gagne en vraisemblance et perd en netteté ; le GAN gagne en netteté et perd en couverture ; la diffusion arbitre différemment. Chaque famille a inventé une astuce pour contourner la limite précédente — reparamétrisation, jeu à deux joueurs, débruitage itératif — mais aucune ne domine sur tous les axes. Le module 8 rend cette tension mesurable : deux modèles au même FID peuvent avoir des précisions et des rappels opposés. Choisir une famille génératrice, c'est arbitrer explicitement ce compromis.

L'entraînement stable et l'échantillonnage rapide ne vont pas ensemble. Le GAN s'entraîne difficilement mais s'échantillonne en une passe. La diffusion s'entraîne comme une MSE stable et s'échantillonne en dix à mille passes. Tous les développements récents (DDIM, DPM-Solver, distillation en modèles à peu de pas, SDXL Turbo) cherchent à récupérer la vitesse d'échantillonnage d'un GAN tout en gardant la stabilité d'entraînement d'une diffusion. C'est le vrai front de recherche moderne.

Le conditionnement change la nature du problème. Un modèle inconditionnel produit des chats plausibles ; un modèle conditionné doit produire le chat demandé. L'attention croisée est le pont technique, le guidage sans classificateur est le levier qui règle l'obéissance à la consigne. À échelle ww trop faible, le modèle ignore le texte ; trop élevée, il sursature. Aucune consigne « moyenne » n'existe : chaque déploiement calibre son ww selon le public visé.

Ce qui manque à un modèle génératif se paie ailleurs. Un GAN sans pénalité de gradient s'effondre. Un VAE sans terme KL redevient un autoencodeur. Une diffusion sans conditionnement de pas produit du bruit à tous les niveaux. Un modèle sans filigrane, sans documentation des données, sans mécanisme de retrait, se paie au tribunal. Les cinq années 2020-2025 ont montré que la fragilité juridique est aussi structurelle que la fragilité mathématique : les deux se prévoient à la conception, pas après.

L'examen final

L'examen comporte 40 questions couvrant les dix modules : distinction entre modélisation de p(yx)p(y \mid x) et de p(x)p(x), écriture de l'ELBO et rôle exact de la reparamétrisation, diagnostic des symptômes d'un GAN qui décroche, choix entre BCE, Wasserstein-GP et normalisation spectrale, prédiction du bruit contre prédiction de x0x_0 en diffusion, conditionnement par CLIP et attention croisée, réglage de l'échelle de guidage, interprétation d'un FID trompeur avec précision-rappel, choix de famille selon la modalité, et obligations juridiques du déploiement.

Plusieurs questions présentent des situations à diagnostiquer : une perte de discriminateur qui s'effondre en dix époques, des images générées qui se répètent, un β\beta-VAE qui rend la même image moyenne, une perte de diffusion qui reste haute, un pipeline texte-image qui ignore les mots précis de la consigne, un FID stable pendant qu'un modèle sacrifie sa diversité, une génération de personnes identifiables sans consentement. C'est le jugement qui est évalué, pas la récitation d'équations.

En cas de réussite, votre attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.

Avant de commencer

Reprenez le tableau ci-dessus et, pour chaque ligne, demandez-vous « quel symptôme verrais-je si je me trompais ici ? ». Si vous savez expliquer pourquoi la KL peut collapser à zéro, pourquoi la BatchNorm casse la pénalité de gradient, et pourquoi un FID plus bas ne veut pas dire « meilleur pour votre usage », vous êtes prêt. Bonne chance !

Examen final

Prêt à valider ce cours ?

40 questions tirées au hasard dans la banque du cours · seuil de réussite 70 % · certificat PDF vérifiable délivré immédiatement en cas de réussite.

Commencer l'examen

Connexion à votre compte InSkillML et abonnement actif requis. Vous pouvez aussi lancer l'examen depuis Mes cours.