Aller au contenu principal

Module 10 — Projet : agent de recherche documentaire encadré

Ce module assemble les neuf précédents. On prend l'agent de veille documentaire, on le finalise, on l'évalue sur un jeu réel de trente questions, on chiffre son coût, on liste ses incidents et on décide s'il peut passer en production. Le but n'est pas de livrer un agent parfait — cela n'existe pas — c'est de rendre un verdict argumenté.

L'agent, en tout

L'agent final combine :

  • La boucle ReAct du module 2, en soixante lignes de Python.
  • Les cinq outils décrits au module 3 : chercher_web, chercher_base, lire_url, noter_fait, finish.
  • Le résumé glissant du module 4 déclenché à 15 000 jetons, avec une base vectorielle pour la mémoire longue.
  • La planification conditionnelle du module 5 activée pour les questions estimées à plus de trois étapes, avec au plus trois révisions.
  • La vérification par outil du module 6 (chaque phrase doit avoir une source ; toute URL citée doit avoir été lue) et une critique par gpt-4o-mini sur les questions techniques.
  • Les garde-fous du module 7 : douze itérations, 40 000 jetons, 90 secondes, aucun outil « effet extérieur » dans cette version.
  • Le journal JSON du module 9, un enregistrement par exécution.

Le code total tient sous 450 lignes de Python, imports et schémas d'outils compris.

Le jeu d'évaluation

Trente questions ont été rédigées à la main par trois personnes de l'équipe produit, en trois catégories.

Dix questions factuelles — « quelle version majeure de Postgres est sortie en septembre 2025 ? ». Réponse courte, vérifiable, une ou deux sources.

Dix questions comparatives — « quels concurrents ont ajouté un tableau Kanban en 2025, et lesquels avec intégration Slack ? ». Réponse structurée, trois à six sources croisées.

Dix questions d'analyse — « comment les concurrents positionnent-ils leurs prix face à une hausse de coûts d'infrastructure en 2025 ? ». Réponse synthétique, cinq à dix sources, jugement à porter.

Pour chaque question, un verdict humain a été établi indépendamment : réponse correcte complète, correcte partielle, incorrecte. Les critères sont documentés dans un guide de trois pages pour rendre les jugements reproductibles entre évaluateurs.

Résultats mesurés

Sur les 30 questions, l'agent obtient :

CatégorieTaux « correct complet »Coût moyenÉtapes médianes
Factuelle90 % (9/10)0,12 EUR4
Comparative70 % (7/10)0,31 EUR9
Analyse50 % (5/10)0,58 EUR14
Total70 % (21/30)0,34 EUR9

Le coût cumulé du jeu d'évaluation est de 10,10 EUR pour un temps de bout en bout de 42 minutes. La distribution des étapes va de 3 (question factuelle simple) à 22 (analyse avec replanification). Le taux de sortie par budget épuisé est de 3,3 % — un seul cas, une question d'analyse.

Rapport d'incidents

L'évaluation a produit neuf réponses non « correctes complètes ». Les incidents se rangent dans les catégories du module 8 :

IncidentNbCauseDécision
Dérive de tâche3Question mal reprise en fin de noteRéinjection question, fait
Autocorrection illusoire2Chiffre transposé, vérificateur d'accordAjout d'un outil verifier_chiffre
Description ambiguë2chercher_base appelé pour info publiqueRéécriture description, fait
Boucle sur soi112 itérations sur la même pagePassage à 15 itérations refusé, plutôt renforcer condition d'arrêt
Sortie tronquée1Budget de jetons atteint à 39 800Ajout d'une sortie partielle propre

Sept correctifs sur les neuf incidents sont structurels — outils, filtres, prompt système révisé. Deux exigent une amélioration pédagogique côté utilisateur : les questions ambiguës rendent souvent les réponses ambiguës.

Décider si l'agent est prêt

La question « prêt pour la production ? » se réduit à trois sous-questions.

Le taux de réussite est-il acceptable pour l'usage ? Ici, 70 % de « correct complet » n'est pas suffisant si l'utilisateur croit lire une note vérifiée. Ce chiffre suffit si l'utilisateur sait qu'il lit une synthèse de premier jet à valider en dix minutes plutôt qu'à écrire en deux heures. Le cadrage du produit prime sur le chiffre brut.

Le coût moyen tient-il face à la valeur ? 0,34 EUR par question, avec un p95 à 1,10 EUR, est bien inférieur au coût d'une recherche humaine — vingt minutes de travail à 40 EUR de l'heure font 13 EUR. Le rapport coût/valeur est net.

Les incidents connus sont-ils sous contrôle ? Aucun incident « effet extérieur non contrôlé » n'a été observé — la palette d'outils rend cet incident impossible par construction. Les incidents résiduels sont des dégradations de qualité, jamais des atteintes à la sécurité ou au budget.

Le verdict est donc : mise en production en interne pour l'équipe produit, avec le cadrage « synthèse de premier jet », un tableau de bord actif et une revue hebdomadaire du taux de réussite. La montée à un usage externe est conditionnée à un taux de 85 % sur les questions comparatives et un vérificateur objectif sur les chiffres.

Ce que le projet apprend

Trois enseignements résument le fil rouge.

La boucle est simple, la fiabilité est chère. L'agent minimal du module 2 tient en soixante lignes ; l'agent qui passe l'évaluation en tient 450. Les 390 lignes ajoutées sont, pour l'essentiel, des garde-fous, des vérifications et de la journalisation — pas de la logique métier.

Les mesures précèdent les décisions. Sans le jeu de 30 questions, aucune des décisions du rapport d'incidents ne serait défendable. Une équipe qui n'a pas ce jeu ne sait pas si son agent progresse ou régresse ; elle le sent.

Un agent en production est un système, pas un modèle. Le modèle change trois fois par an et remplacera d'ailleurs le vôtre. Ce qui restera, ce sont vos outils, vos jeux d'évaluation, vos journaux et vos garde-fous. Investissez le temps de conception là.

En résumé

  • L'agent final assemble boucle, outils, mémoire, plan, critique, garde-fous, journal — 450 lignes, dont 60 pour la logique.
  • Le jeu de 30 questions catégorisées donne un taux de 70 % correct complet, un coût moyen de 0,34 EUR, une médiane de 9 étapes.
  • Les incidents relèvent des patrons du module 8 ; sept correctifs sur neuf sont structurels.
  • Le passage en production est décidé par cadrage produit, coût/valeur, contrôle des incidents — jamais par une intuition sur l'intelligence de l'agent.

Module suivant : la récapitulation complète et l'annonce de l'examen final.