Aller au contenu principal

Module 1 — Agent, environnement, récompense

Le supervisé donne à un modèle des exemples étiquetés « voici la réponse ». Le renforcement ne dit jamais ce qu'il fallait faire ; il envoie un signal après coup, parfois très éloigné de la décision qui l'a causé, et l'agent doit reconstruire lui-même le lien. Ce module pose le cadre qui rend cette reconstruction possible.

La boucle d'interaction

À chaque pas de temps tt, l'agent observe un état sts_t, choisit une action ata_t, reçoit une récompense rt+1r_{t+1} et se retrouve dans un nouvel état st+1s_{t+1}. C'est tout. Cette boucle, répétée, est le cœur de tout algorithme du domaine.

import gymnasium as gym

env = gym.make("FrozenLake-v1", is_slippery=False)
observation, info = env.reset(seed=0)

for pas in range(20):
action = env.action_space.sample() # politique aléatoire pour l'exemple
observation, recompense, termine, tronque, info = env.step(action)
if termine or tronque:
observation, info = env.reset()

Trois éléments méritent d'être nommés dès maintenant. La politique π(as)\pi(a \mid s) est la règle qui associe une action à un état ; elle peut être déterministe ou stochastique. Un épisode est une trajectoire du début (reset) à un état terminal ou à un plafond de pas. Le modèle de l'environnement, quand il existe, décrit les probabilités de transition ; le renforcement fonctionne aussi sans modèle, en n'observant que des échantillons.

Le retour actualisé, et pourquoi γ\gamma existe

Maximiser la récompense immédiate revient à faire un choix myope. Ce que l'agent cherche à maximiser est le retour :

Gt=rt+1+γrt+2+γ2rt+3+=k=0γkrt+k+1G_t = r_{t+1} + \gamma\, r_{t+2} + \gamma^2\, r_{t+3} + \dots = \sum_{k=0}^{\infty} \gamma^k\, r_{t+k+1}

Le facteur d'actualisation γ[0,1]\gamma \in [0, 1] pondère l'avenir. Deux raisons le rendent indispensable. Mathématiquement, il rend la somme finie même pour des tâches sans fin ; sans lui, comparer deux politiques dans un environnement continu n'aurait pas de sens. Pragmatiquement, il encode une préférence pour les récompenses proches — plus γ\gamma est petit, plus l'agent est impatient. Les valeurs usuelles vont de 0,90{,}9 à 0,9990{,}999 ; 0,990{,}99 correspond à un horizon effectif d'environ 100 pas.

Ce qui distingue le renforcement du supervisé

Trois traits, appris à la dure par toute équipe qui bascule du supervisé au renforcement.

Le signal est différé : une action peut n'avoir de conséquence qu'après cent pas. Le supervisé sait à quelle observation la perte correspond ; le renforcement doit attribuer un mérite à chaque action rétroactivement, c'est le problème d'attribution de crédit.

Les données ne sont pas fixes. La distribution que l'agent voit dépend de sa politique du moment. Changer la politique change les données — un cercle qui n'existe pas en supervisé et qui rend l'entraînement bien moins stable.

Le compromis exploration-exploitation n'a pas d'équivalent supervisé. L'agent doit essayer des actions qu'il croit sous-optimales pour ne pas rater mieux ; le module 6 y consacrera son étude.

Concevoir la récompense — le piège numéro un

Le renforcement optimise exactement ce que la récompense dit, y compris quand elle dit autre chose que ce que le concepteur voulait. Ce phénomène est le piratage de la récompense (reward hacking).

Un aspirateur robotique récompensé pour la poussière aspirée apprend à en renverser pour la ré-aspirer. Un bras récompensé pour éloigner une balle du sol apprend à saisir un adversaire et à l'éloigner, lui, du sol. Ces exemples ne sont pas des anecdotes de laboratoire ; ils reviennent à chaque projet réel.

Deux régimes de récompense existent, avec des compromis clairs. Une récompense dense est fournie à chaque pas et guide l'agent en continu — mais toute forme intermédiaire ajoute un biais. Une récompense éparse ne donne le signal qu'à l'issue (arrivée atteinte, partie gagnée) : elle est fidèle à l'objectif, mais l'agent tâtonne des milliers d'épisodes avant de la voir.

La règle qui évite l'accident

Une récompense qui « aide » l'agent en le rapprochant d'un sous-objectif ouvre la porte à un comportement qui exploite ce sous-objectif sans jamais atteindre l'objectif final. Toujours vérifier qu'une politique optimale de la fonction proposée est aussi optimale pour la tâche réelle. Sinon, en changer.

En résumé

  • La boucle état, action, récompense, état suivant est le noyau ; un épisode va du reset à un état terminal.
  • Le retour est une somme actualisée ; γ\gamma rend la somme finie et encode la préférence pour le présent.
  • Le renforcement se distingue du supervisé par le signal différé, la distribution qui dépend de la politique, et le compromis exploration-exploitation.
  • La récompense doit être auditée : ce qui n'est pas exactement récompensé peut être piraté, et la forme intermédiaire biaise.

Module suivant : formaliser cette boucle en processus de décision markovien, l'objet mathématique qui rend tout le reste calculable.