Aller au contenu principal

Récapitulation et examen final

Dix modules pour passer de la boucle « état, action, récompense » à un pilote LunarLander entraîné et évalué proprement. Voici le cours condensé, puis les fils qui le traversent.

Le cours d'un coup d'œil

ModuleL'essentiel à retenir
1. CadreBoucle d'interaction, retour actualisé, piratage de récompense — auditer la fonction de récompense avant tout
2. MDPTuple (S,A,P,R,γ)(\mathcal{S}, \mathcal{A}, P, R, \gamma) ; l'hypothèse de Markov est un choix de représentation
3. BellmanVV et QQ, équation d'espérance linéaire, équation d'optimalité avec max — connaître QQ^* suffit
4. DP et Monte-CarloProgrammation dynamique quand PP est connu ; Monte-Carlo attend la fin d'épisode et a forte variance
5. TD et Q-learningErreur TD r+γV(s)V(s)r + \gamma V(s') - V(s) ; SARSA sur politique, Q-learning hors politique via max
6. Explorationε\varepsilon-glouton décroissant est le standard ; « ne converge pas » vient presque toujours d'ici
7. DQNRéseau + rejeu + réseau cible ; Double DQN corrige la surestimation par séparation sélection/évaluation
8. Gradient de politiqueREINFORCE : monter la log-probabilité proportionnellement au retour ; variance immense, ligne de base indispensable
9. PPOAvantage A=QVA = Q - V, acteur-critique, troncature du rapport à 1±ε1 \pm \varepsilon pour plusieurs passages
10. ProjetCinq graines minimum, médiane et intervalles, évaluation sur graines nouvelles, vidéo — sinon rien n'est prouvé

Les fils qui traversent le cours

La carte des algorithmes tient en quatre axes. Tabulaire ou profond, valeur ou politique, sur ou hors politique, modèle connu ou non. Chaque méthode du cours occupe une case précise : Q-learning est tabulaire, valeur, hors politique, sans modèle ; DQN est profond, valeur, hors politique, sans modèle ; REINFORCE est profond, politique, sur politique, sans modèle ; PPO ajoute un critique et une contrainte de proximité. Savoir placer un algorithme dans cette grille, c'est comprendre à quelle famille de problèmes il s'adresse.

Tout retourne à Bellman. L'équation d'espérance justifie la mise à jour TD ; l'équation d'optimalité, avec son max, justifie Q-learning ; l'ajout d'un réseau à cette dernière donne le DQN. Même le critique de A2C n'est qu'un régresseur qui apprend VπV^{\pi} par TD. Comprendre Bellman, c'est comprendre pourquoi ces algorithmes ont la forme qu'ils ont, et non une autre.

La variance est l'ennemi caché. Monte-Carlo a une variance élevée à cause du retour complet. Le max de DQN introduit un biais qui interagit avec la variance des estimations. REINFORCE fait pire encore. Chaque avancée majeure — TD, réseau cible, avantage, GAE, PPO — est une réduction de variance ou de biais mieux dosée. Lire un article de renforcement, c'est presque toujours identifier quelle source de bruit il attaque.

La récompense est un contrat. Le module 1 le disait : le renforcement optimise ce que la récompense dit, littéralement. Aucun algorithme du cours ne corrige une mauvaise spécification ; ils l'amplifient. Un projet réel commence par une revue de la récompense avec les personnes qui connaissent le domaine, pas par un choix d'algorithme.

L'examen final

L'examen comporte 40 questions couvrant les dix modules : formulation d'un problème en MDP et détection d'une violation de Markov, calcul de Bellman à la main sur une petite grille, choix entre programmation dynamique et Monte-Carlo, écriture d'une mise à jour TD, différence pratique SARSA / Q-learning sur cliff walking, réglage d'ε\varepsilon et diagnostic d'exploration insuffisante, rôle du rejeu et du réseau cible, biais d'optimisme et Double DQN, variance de REINFORCE et effet d'une ligne de base, lecture de l'objectif tronqué de PPO, protocole d'évaluation multi-graines et pièges sim-to-real.

Plusieurs questions présentent des situations à diagnostiquer : un agent bloqué à récompense nulle, un DQN dont les QQ divergent, un REINFORCE dont la perte fluctue sans que la récompense ne monte, une courbe unique sans graine, une politique sur-optimisée qui échoue sur une variation mineure. C'est le jugement qui est évalué, pas la récitation.

En cas de réussite, votre attestation d'achèvement est délivrée immédiatement ; son numéro est vérifiable par tout tiers sur la plateforme.

Avant de commencer

Reprenez la carte des algorithmes ci-dessus et, pour chacun, demandez-vous « quel problème résout-il par rapport au précédent, et à quel prix ? ». Si vous savez expliquer pourquoi le rejeu ne s'applique pas à REINFORCE, pourquoi la troncature de PPO autorise plusieurs époques, et pourquoi une courbe unique de renforcement ne prouve rien, vous êtes prêt. Bonne chance !

Examen final

Prêt à valider ce cours ?

40 questions tirées au hasard dans la banque du cours · seuil de réussite 70 % · certificat PDF vérifiable délivré immédiatement en cas de réussite.

Commencer l'examen

Connexion à votre compte InSkillML et abonnement actif requis. Vous pouvez aussi lancer l'examen depuis Mes cours.