Aller au contenu principal

Stable Diffusion : génération et contrôle d'images par diffusion latente

Comment un modèle de diffusion latente transforme quelques mots en image, et surtout comment le contraindre pour qu'il produise la vôtre : une chaise dans dix ambiances, la même pose sous trois angles, un style maison réutilisable. Le cours part des trois composants qui rendent Stable Diffusion possible, puis empile les outils qui rendent son résultat prévisible.

Durée du cours : 6h

Ce que vous allez apprendre

  • Décrire les trois composants d'un modèle de diffusion latente et leurs rôles respectifs
  • Rédiger une consigne positive et une consigne négative qui corrigent des défauts réels
  • Régler le nombre d'étapes, l'échelle de guidage et la graine pour la reproductibilité
  • Enchaîner texte vers image, image vers image, retouche par masque et extension de cadre
  • Conditionner une génération avec ControlNet (pose, contours, profondeur)
  • Entraîner un LoRA de style à partir de 20 à 40 images sans surapprentissage visuel
  • Estimer le coût de calcul, la mémoire nécessaire et le temps par image selon le matériel
  • Décider ce qui est diffusable à partir des licences, marques et personnes reconnaissables

Prérequis

  • Cours 15 — IA générative (échantillonnage, diffusion, conditionnement)
  • Python et gestion d'environnements virtuels
  • Notions sur les convolutions et les autoencodeurs

Modules du cours

  1. Diffusion latente : autoencodeur, U-Net, planificateur
  2. Consignes positives et négatives
  3. Nombre d'étapes, échelle de guidage, graine aléatoire
  4. De texte vers image et d'image vers image
  5. Retouche par masque et extension de cadre
  6. ControlNet : pose, contours, profondeur
  7. LoRA et inversion textuelle pour un style
  8. Mise à l'échelle et correction des visages
  9. Coût de calcul et optimisation mémoire
  10. Droits, provenance et usages acceptables

Fil rouge

Tout le cours applique les techniques à une même petite marque de mobilier : une chaise de référence, déclinée en ambiances, retouchée, étendue au format bannière, contrainte en pose par ControlNet, puis restituée dans un style maison appris par LoRA et enfin mise à l'échelle pour l'impression. Le modèle de référence est SDXL, avec SD 1.5 mentionné pour les machines modestes. L'outil est la bibliothèque diffusers en Python, avec les équivalents ComfyUI signalés lorsque l'interface graphique éclaire davantage la mécanique.

Évaluation et attestation

Le parcours se termine par un examen de 40 questions qui couvre tous les modules. En cas de réussite, une attestation d'achèvement est délivrée ; son numéro est vérifiable sur la plateforme.

Les cours gratuits, eux, se concluent par un quiz de 5 questions avec un aperçu de l'attestation, sans certification.