Aller au contenu principal

Chargement du lab visuel…

#alignement-rlhfLLM et transformers

Alignement et RLHF : apprendre ce que les humains préfèrent.

Ce que tu vas manipuler

  1. Bienvenue dans #alignement-rlhf. À l'écran, les 12 réponses qu'un modèle de base peut donner à « Comment bien dormir ? », disposées en arc : la taille d'une bulle est la probabilité que le modèle la produise, et elles sont grises parce qu'aucun modèle de récompense n'existe encore. Un modèle de base sait écrire, pas plaire : il lâche aussi bien « Dors, simplement » qu'un vrai conseil. Le RLHF (apprentissage par renforcement à partir de retours humains) le corrige en trois étapes : collecter des préférences humaines entre paires de réponses, entraîner un modèle de récompense qui les imite, puis optimiser la politique pour maximiser cette récompense sous un garde-fou KL. Les contours sont une triche pédagogique réservée à toi : vert = réponse vraiment utile, rouge = dangereuse. Le modèle de récompense, lui, ne les verra jamais.
  2. Première étape : collecter des préférences. Tape /comparer : le modèle de base génère deux réponses, A et B, que tu vas devoir départager.
  3. Lis A et B, puis dis laquelle tu préfères : /preferer a ou /preferer b. Tu n'écris pas la bonne réponse, tu ne notes pas sur 10 : tu tranches entre deux. C'est exactement le travail des annotateurs du RLHF, répété des dizaines de milliers de fois.
  4. Une paire ne suffit pas. Tape /auto 20 : un juge simulé, qui compare selon l'utilité et la sécurité réelles des réponses (avec un peu de bruit), tranche 20 nouvelles paires tirées du modèle de base.
  5. Deuxième étape : tape /recompense pour entraîner le modèle de récompense sur ces paires. Il ne voit ni l'utilité ni la sécurité : seulement trois indices de surface — longueur, mots positifs, marqueurs concrets (chiffres, durées). Il apprend r(x) = w · f(x) pour que P(a ≻ b) = σ(r(a) − r(b)) colle aux jugements : c'est le modèle de Bradley-Terry.
  6. Troisième étape : optimiser la politique. Tape /pas 30 : 30 itérations de logits ← logits + lr · (r − r̄ − β · (log π − log π₀)). Le terme en β est la pénalité KL : il retient la politique près du modèle de base π₀ (β = 0,5 pour l'instant).
  7. Et si on retirait le garde-fou ? Tape /kl 0 : β = 0, plus aucune pénalité. La politique sera libre de maximiser la récompense sans se demander d'où viennent les réponses.
  8. Relance l'optimisation : /pas 50. Surveille la réponse 11 (« 7 astuces géniales »), la jauge KL, la barre de longueur et l'utilité réelle attendue.
  9. À toi de jouer : /reponse 11 pour lire la réponse gagnante et ses attributs cachés ; /echantillonner pour tirer une réponse selon la politique actuelle ; /comparer puis un jugement pour voir ce que la politique dérivée propose désormais aux juges ; /auto 40 puis /recompense pour corriger le modèle de récompense avec des paires issues de la politique dérivée (RLHF itératif) ; /kl 0,5 puis /pas 50 pour voir la pénalité ramener la politique vers les bonnes réponses ; /lr 0,1 pour une optimisation plus douce ; /reinit pour repartir. Prochaine étape : #bandit-manchot, premier canal du thème renforcement, où l'on découvre l'exploration et l'exploitation, à la racine de tout apprentissage par récompense.

Commandes du canal

  • /comparerTire deux réponses selon la politique courante : une paire A / B à juger.
  • /preferer <a|b>Enregistre ton jugement sur la paire courante : a ou b.
  • /auto <5..40>Ajoute n jugements simulés : paires tirées selon la politique, tranchées par le juge (utilité + sécurité, bruité).
  • /recompenseRéentraîne le modèle de récompense linéaire (Bradley-Terry) sur toutes les paires jugées.
  • /pas <1..50>n itérations d'optimisation de la politique : logits ← logits + lr·(r − r̄ − β·(log π − log π₀)).
  • /kl <0..1>Coefficient β de la pénalité KL : force qui retient la politique près du modèle de base.
  • /lr <0.01..1>Taux d'apprentissage de l'optimisation de la politique.
  • /reponse <1..12>Met une réponse en avant (anneau blanc) et révèle ce que voit le modèle de récompense… et ce qu'il ne voit pas.
  • /echantillonnerTire une réponse selon la politique courante et l'affiche en entier.
  • /reinitRevient au modèle de base : aucune paire, modèle de récompense vierge, β = 0,5, lr = 0,5.

Glossaire

alignement
Faire en sorte qu'un modèle fasse ce que ses utilisateurs veulent vraiment — utile, honnête, sans danger — et pas seulement ce que mesure son objectif d'entraînement. Un modèle de base prédit le mot suivant ; l'alignement le transforme en assistant. Le RLHF en est la recette la plus répandue.
RLHF
Apprentissage par renforcement à partir de retours humains (Reinforcement Learning from Human Feedback) : (1) des humains comparent des paires de réponses, (2) un modèle de récompense apprend à imiter ces préférences, (3) la politique (le LLM) est optimisée pour maximiser cette récompense sous une pénalité KL. C'est ce qui a fait passer GPT-3 à ChatGPT.
modèle de récompense
Modèle qui attribue un score r(x) à une réponse, entraîné pour reproduire les préférences humaines. Il remplace le juge humain pendant l'optimisation, où il faut noter des millions de réponses. Ici il est linéaire sur trois indices de surface ; en vrai c'est un LLM avec une tête scalaire. C'est un substitut : fiable près des données qu'il a vues, hasardeux ailleurs.
préférences par paires (Bradley-Terry)
Plutôt qu'une note absolue, on demande au juge « A ou B ? ». Le modèle de Bradley-Terry relie ce choix aux scores : P(a ≻ b) = σ(r(a) − r(b)). Entraîner le modèle de récompense revient à maximiser la vraisemblance des jugements observés. Les comparaisons sont plus fiables et plus cohérentes entre annotateurs que des notes sur 10.
politique (LLM)
En renforcement, la politique π est ce qui choisit les actions ; en RLHF, c'est le modèle de langage lui-même : une distribution sur les réponses possibles. Ici, une softmax sur 12 réponses. Le modèle de base π₀ est la politique de départ, gardée figée comme référence.
PPO
Proximal Policy Optimization : l'algorithme de renforcement le plus utilisé pour la troisième étape du RLHF. Il monte le gradient de la récompense attendue en limitant la taille de chaque pas (ratio de probabilités borné). La version jouet du canal garde l'essentiel : logits ← logits + lr · (r − r̄ − β · (log π − log π₀)), où est la récompense moyenne (ligne de base).
pénalité KL
Terme β · KL(π ‖ π₀) retranché à la récompense : il pénalise la politique quand elle s'éloigne du modèle de base. Sans lui, la politique file vers les réponses que le modèle de récompense surnote sans les avoir vues. Le point fixe est π ∝ π₀ · exp(r / β) : β grand = prudent, β petit = audacieux, β = 0 = sans garde-fou.
détournement de récompense
Reward hacking : la politique trouve des réponses qui obtiennent une haute récompense sans satisfaire l'intention derrière (loi de Goodhart). Ici : des réponses longues, flatteuses et truffées de chiffres, que le modèle de récompense surnote par extrapolation, alors que leur utilité réelle est faible. La pénalité KL et un modèle de récompense régulièrement ré-entraîné sur la politique courante sont les parades classiques.
flagornerie
Sycophancy : tendance d'un modèle aligné par RLHF à flatter l'utilisateur, à approuver ses opinions et à enrober ses réponses, parce que les juges humains ont légèrement préféré ce ton et que le modèle de récompense l'a amplifié. Cas particulier de détournement de récompense, visible ici dans les réponses « Excellente question ! ».
DPO, RLAIF et IA constitutionnelle
Trois variantes du RLHF. DPO (Direct Preference Optimization) saute le modèle de récompense et l'algorithme de renforcement : une perte directe sur les paires préférées ajuste la politique, avec la même pénalité implicite vers π₀. RLAIF remplace les juges humains par un LLM qui applique une liste de principes — la « constitution » de l'IA constitutionnelle d'Anthropic — pour produire les préférences à grande échelle.

Autres canaux du thème LLM et transformers

  • #tokenisationTokenisation et BPE : comment un LLM découpe le texte.
  • #attentionSelf-attention : chaque mot regarde les autres.
  • #transformer-blocLe bloc transformer : attention, résidus, normalisation, FFN.
  • #generation-temperatureGénération : température, top-k et top-p.
  • #ragRAG : répondre en s'appuyant sur ses documents.
  • #alignement-rlhfAlignement et RLHF : apprendre ce que les humains préfèrent.