Aller au contenu principal

Apprentissage par renforcement

Apprentissage par renforcement, des processus de décision markoviens aux méthodes profondes.

Durée du cours : 8h

Ce que vous allez apprendre

  • Formuler un problème en états, actions et récompenses
  • Comprendre le compromis entre exploration et exploitation
  • Implémenter le Q-learning sur un environnement simple
  • Expliquer ce que le réseau profond apporte au Q-learning
  • Choisir une méthode selon la nature de l'espace d'actions

Prérequis

  • Python et NumPy
  • Notions de probabilités et de deep learning

Modules du cours

  1. Agent, environnement, récompense : le cadre
  2. Processus de décision markoviens
  3. Fonctions de valeur et équations de Bellman
  4. Programmation dynamique et méthodes de Monte-Carlo
  5. Différence temporelle et Q-learning
  6. Exploration : epsilon glouton et alternatives
  7. Réseaux Q profonds et rejeu d'expérience
  8. Méthodes de gradient de politique
  9. Acteur-critique, A2C et PPO
  10. Projet : agent entraîné sur un environnement Gymnasium

Évaluation et attestation

Le parcours se termine par un examen de 40 questions qui couvre tous les modules. En cas de réussite, une attestation d'achèvement est délivrée ; son numéro est vérifiable sur la plateforme.

Les cours gratuits, eux, se concluent par un quiz de 5 questions avec un aperçu de l'attestation, sans certification.