Aller au contenu principal

Chargement du lab visuel…

#planification-reflexionIA agentique

Planification, réflexion et self-correction : de 60 % à 90 % de succès.

Ce que tu vas manipuler

  1. Bienvenue dans #planification-reflexion. La scène est encore vide : pas d'arbre, jauge de confiance à 0 %. C'est le point de départ de tout agent — il ne sait pas comment décomposer sa tâche. Un agent robuste ne se contente pas de penser-agir-observer comme dans #boucle-agentique : il planifie d'abord (décompose l'objectif en 5 à 7 sous-tâches), exécute dans l'ordre, vérifie, et réfléchit sur ses échecs pour re-planifier. C'est Plan-and-Execute (Wang et al., 2023) prolongé par Reflexion (Shinn et al., 2023) : les agents avec plan explicite passent d'environ 60 % à 90 % de succès sur les tâches multi-étapes. En haut : le bandeau de phase et la jauge. En bas : l'objectif courant.
  2. Charge un objectif prêt à l'emploi : /scenario refactor. L'agent doit refactorer un module en 3 fichiers — on va voir apparaître la sphère bleue « racine » (l'objectif) au-dessus, mais aucun sous-plan encore.
  3. Décompose l'objectif : /planifier. Regarde les 5 sphères grises pousser une par une sous la racine — Analyser, Séparer en 3 fichiers, Extraire les types, Ajuster les imports, Lancer les tests.
  4. Exécute le premier nœud : /pas. La sphère Analyser le module pulse en bleu (elle est en-cours), puis passe au vert avec un . La jauge de confiance monte de 0 à environ 20 %.
  5. Continue : /pas. Cette fois le nœud Séparer en 3 fichiers échoue (rouge, ). L'agent bloque en phase RÉFLEXION — la jauge redescend, un halo violet apparaît en douceur autour du nœud raté.
  6. Répare le plan : /reflechir. Le nœud raté passe en or (☆ replanifié, l'ancien reste tracé mais gris et fin), et un nouveau Séparer + tests unitaires apparaît juste à côté, prêt à exécuter.
  7. Laisse la boucle finir toute seule : /tourner. Elle enchaîne le correctif puis les nœuds restants, jusqu'au bandeau ✓ TERMINÉ. La jauge de confiance atteint son maximum et l'aperçu droit résume tout : 5 succès, 1 replanifié.
  8. À toi. Essaie /scenario donnees, /planifier, /budget 5 1 puis /tourner — le plafond de pas tombe avant la fin, bandeau ✕ ÉCHEC DÉFINITIF (une leçon clé sur le halting problem des agents). Ou /scenario recherche, /planifier, /pas plusieurs fois, /verifier nok pour forcer un échec sur un nœud réussi, /objectif Migrer PostgreSQL 15 vers 16 pour redéfinir la cible, /reinit pour repartir. Prochaine étape : #multi-agents (Premium) où un planner, des workers et un verifier se répartissent explicitement le travail — ou revenir en gratuit sur #boucle-agentique.

Commandes du canal

  • /scenario <refactor|donnees|recherche>Charge un objectif prêt à l'emploi (racine seule).
  • /planifierDécompose l'objectif en 5 sous-tâches (arbre de plan).
  • /pasExécute le prochain nœud en attente (succès ou échec déterministe).
  • /tournerBoucle exécution + réflexion jusqu'à terminé ou échec définitif.
  • /reflechirSur le dernier nœud en échec : replanifie (halo violet + sous-arbre en or).
  • /verifier <ok|nok>Force le verdict du dernier nœud exécuté (utile pour explorer les branches).
  • /budget <pas=3..20> <reflexions=0..5>Fixe les garde-fous : pas max et réflexions max.
  • /objectif <texte>Redéfinit l'objectif et réinitialise l'arbre.
  • /reinitRemet le canal dans son état initial (arbre vide).

Glossaire

Plan-and-Execute
Motif d'agent qui sépare deux rôles : le planificateur décompose l'objectif en sous-tâches ordonnées, puis l'exécuteur les traite une à une. Article de référence : Plan-and-Solve Prompting (Wang et al., 2023). Comparé à la boucle ReAct pure (canal #boucle-agentique), la trace est vérifiable avant exécution — on économise des appels LLM sur les mauvaises trajectoires.
Reflexion
Technique où l'agent, après un échec, produit une self-critique en langue naturelle qu'il ajoute à son contexte pour re-tenter en tenant compte de la leçon. Article : Reflexion: Language Agents with Verbal Reinforcement Learning (Shinn et al., 2023). Améliore drastiquement les taux de succès sur HumanEval, HotpotQA et ALFWorld.
Tree-of-Thought
Généralisation de la chaîne-de-pensée : plutôt qu'une seule ligne de raisonnement, l'agent explore un arbre de raisonnements possibles, en évaluant chaque branche. Article : Tree of Thoughts (Yao et al., 2023). Coûteux en tokens mais efficace sur les tâches qui exigent de revenir en arrière (planification, mots croisés, jeu de 24).
décomposition de tâche
Casser un objectif de haut niveau (« Refactorer ce module ») en 5-10 sous-tâches concrètes et exécutables. C'est la brique de base de Plan-and-Execute : sans elle, un LLM se perd à mi-parcours. Bonne heuristique : chaque sous-tâche tient dans une phrase et se vérifie en 1-2 minutes.
verifier
Composant (souvent un second appel LLM, parfois un test unitaire ou un typecheck) qui vérifie qu'une sous-tâche a réellement réussi. Sans verifier, l'agent croit sur parole ses propres actions et cumule les erreurs silencieuses. Le canal #multi-agents (Premium) formalise le rôle.
self-correction
Capacité d'un agent à détecter ses propres erreurs et à en corriger le tir. Concrètement : verifier → détecte l'échec → réflexion → nouvelle stratégie. Amplifie la fiabilité des agents mais ne suffit pas seul : sans ground truth externe, un LLM peut « corriger » vers une réponse tout aussi fausse.
halting problem des agents
Un agent LLM peut boucler éternellement (répéter la même action, penser sans agir, se perdre en réflexions). Il n'existe pas de garantie théorique d'arrêt : c'est pourquoi tout agent en production embarque un budget dur (pas max, réflexions max, coût max) et un kill-switch — pas une option, une nécessité.
budget d'itérations
Plafond dur au-delà duquel l'agent s'arrête, même sans réponse. Deux dimensions ici : pas (nombre de nœuds exécutés) et reflexions (nombre de replanifications). Tape /budget 5 1 avec le scénario donnees pour voir le plafond de pas déclencher un ÉCHEC DÉFINITIF.
replanification
Action d'ajouter (ou remplacer) une branche du plan initial après un échec. Ici : l'ancien nœud passe en or (marqué ☆), un nouveau sous-arbre apparaît. Différent d'une simple ré-exécution : on change la stratégie, pas seulement les arguments.
arbre de plan
Représentation hiérarchique d'un objectif : racine = objectif global, enfants = sous-tâches, petits-enfants = sous-sous-tâches. Rendu ici en 3D à deux niveaux (racine + feuilles) pour rester lisible ; les vrais agents peuvent aller à 3-4 niveaux avec des sous-plans imbriqués.

Autres canaux du thème IA agentique

  • #boucle-agentiqueBoucle ReAct d'un agent : Pensée → Action → Observation en direct.
  • #outils-appelAppel d'outil (function calling / MCP) : le JSON qui fait agir le LLM.
  • #slash-commandsSlash commands à la Claude Code / Cursor : templates, arguments, enchaînement.
  • #contexte-memoireFenêtre de contexte et mémoire d'agent : compter, tronquer, résumer, indexer.
  • #planification-reflexionPlanification, réflexion et self-correction : de 60 % à 90 % de succès.
  • #multi-agentsMulti-agents : planner, workers, verifier. Un DAG qui bat l'agent monolithique.