Module 9 — Entraînement distribué sur plusieurs accélérateurs
Quand un modèle tient en mémoire mais que l'entraînement prend trois jours, la distribution devient intéressante. TensorFlow la rend étonnamment simple à écrire, ce qui masque deux réglages qu'il faut absolument ajuster à la main.
Le principe : répliquer le modèle, partager le lot
La stratégie la plus courante réplique le modèle entier sur chaque accélérateur. Chaque réplique reçoit une fraction du lot, calcule ses gradients, puis tous les gradients sont moyennés et appliqués de façon identique partout. Les répliques restent ainsi rigoureusement synchronisées.
C'est le parallélisme de données. Il suppose que le modèle tient dans la mémoire d'un seul accélérateur. Quand ce n'est plus le cas — les grands modèles de langage du cours 16 — il faut du parallélisme de modèle, qui découpe le réseau lui-même et sort du cadre de ce module.