📄️ Apprentissage par renforcement
Apprentissage par renforcement, du cadre MDP au Q-learning tabulaire, aux DQN et à PPO. Durée : 8h, avec un examen de 40 questions et une attestation vérifiable.
📄️ 1. Agent, environnement, récompense
Module 1 du cours premium Apprentissage par renforcement : la boucle d'interaction, la notion d'épisode, le retour actualisé et les pièges de la conception de la récompense.
📄️ 2. Processus de décision markoviens
Module 2 du cours premium Apprentissage par renforcement : états, actions, probabilités de transition, politique et hypothèse de Markov, appliqués à FrozenLake.
📄️ 3. Valeur et Bellman
Module 3 du cours premium Apprentissage par renforcement : fonctions V et Q, équations d'espérance et d'optimalité de Bellman, calcul manuel sur une grille 3x3.
📄️ 4. DP et Monte-Carlo
Module 4 du cours premium Apprentissage par renforcement : itération de la valeur et de la politique quand le modèle est connu, Monte-Carlo quand il ne l'est pas.
📄️ 5. Différence temporelle et Q-learning
Module 5 du cours premium Apprentissage par renforcement : mise à jour TD, SARSA contre Q-learning, sur et hors politique, implémentation tabulaire sur FrozenLake.
📄️ 6. Exploration
Module 6 du cours premium Apprentissage par renforcement : dilemme exploration-exploitation, décroissance d'epsilon, softmax et UCB, démonstration d'une exploration insuffisante.
📄️ 7. Réseaux Q profonds
Module 7 du cours premium Apprentissage par renforcement : approximation de Q par réseau, tampon de rejeu, réseau cible, instabilités, Double DQN et CartPole.
📄️ 8. Gradient de politique
Module 8 du cours premium Apprentissage par renforcement : politique stochastique paramétrée, REINFORCE, variance et ligne de base, actions continues, CartPole par REINFORCE.
📄️ 9. Acteur-critique et PPO
Module 9 du cours premium Apprentissage par renforcement : fonction d'avantage, A2C, objectif tronqué de PPO, hyperparamètres, comparaison maison contre Stable-Baselines3 sur LunarLander.
📄️ 10. Projet Gymnasium
Module 10 du cours premium Apprentissage par renforcement : projet complet LunarLander, graines et variabilité, courbes avec intervalles, enregistrement vidéo, limites du transfert au réel.
📄️ Récapitulation et examen
Récapitulation complète du cours premium Apprentissage par renforcement : MDP, Bellman, Q-learning, DQN, gradient de politique, PPO, puis l'examen de 40 questions.