Module 8 — Coût, latence et limites de l'approche
Les modules précédents ont montré ce qu'une équipe d'agents savait faire. Ce module montre ce qu'elle coûte, mesuré sur le fil rouge, et ce qui, dans sa nature même, empêche cette approche de convenir à tous les cas. C'est le module que les démonstrations gomment et qui pèse le plus quand on décide de mettre CrewAI en production.
Le nombre d'appels au LLM par exécution
Une exécution CrewAI produit beaucoup plus d'appels au modèle que le nombre de tâches ne le suggère. Voici la comptabilité honnête, pour notre fil rouge à quatre agents et quatre tâches en processus séquentiel :
- Tâche d'analyse : un appel principal, plus deux ou trois appels d'outils (lecture du fichier de spécifications, éventuelle recherche) — chaque appel d'outil rappelle le modèle avec le résultat.
- Tâche de rédaction : un appel principal, plus deux appels d'outils (glossaire, guide de style) et éventuellement une itération pour reformuler.
- Tâche de relecture : un appel principal, plus un ou deux appels d'outils, souvent une itération pour lister précisément les problèmes.
- Tâche d'arbitrage : un appel principal, plus zéro à deux appels d'outils selon la profondeur de la vérification.
Total pratique : entre 12 et 20 appels au LLM pour une seule exécution. En processus hiérarchique, ajoutez les appels du gestionnaire — souvent un par attribution et un par validation — et vous doublez ce nombre.
Cette réalité fait passer le raisonnement de « quel modèle choisir » à « combien d'appels chaque modèle produit ». Un modèle bon marché appelé quinze fois peut coûter plus cher qu'un modèle premium appelé trois fois.
Facture mesurée sur le fil rouge
Sur notre équipe de rédaction, avec gpt-4o-mini pour tous les agents et une documentation cible de dix pages, une exécution complète en septembre 2026 consomme approximativement :
| Poste | Jetons d'entrée | Jetons de sortie | Coût approché |
|---|---|---|---|
| Analyste (avec spécifications) | 8 000 à 12 000 | 800 à 1 500 | quelques centimes |
| Rédacteur (dix sections) | 15 000 à 25 000 | 4 000 à 6 000 | quelques dizaines de centimes |
| Relecteur | 6 000 à 10 000 | 1 000 à 2 000 | quelques centimes |
| Responsable | 3 000 à 5 000 | 300 à 500 | quelques centimes |
| Consignes système et outils | 6 000 à 10 000 | — | quelques centimes |
Une exécution complète coûte de l'ordre de 0,20 à 0,50 dollar avec un modèle mini, et facilement 2 à 5 dollars si vous passez tout le monde sur un modèle premium. Multipliée par 100 exécutions par jour, la facture mensuelle passe de quelques dizaines à quelques centaines de dollars — l'écart n'est pas anodin.
Latence et variabilité
La durée d'une exécution CrewAI dépend surtout du nombre d'appels série au LLM, pas du volume de jetons. Chaque appel ajoute la latence réseau, la latence de génération (souvent 300 ms à 3 s selon la longueur de sortie) et un peu de traitement local. Sur notre fil rouge, comptez 45 à 120 secondes pour une exécution complète en séquentiel, 90 à 240 secondes en hiérarchique.
Cette latence n'est pas interactive. Une équipe CrewAI est un asynchrone : on la lance, on part faire autre chose, on revient. C'est la première contrainte à énoncer au client. Si votre cas d'usage exige une réponse en moins de dix secondes, une équipe multi-agents ne peut pas y répondre — un agent unique bien consigné, oui.
La variabilité est l'autre poste souvent sous-estimé. Deux exécutions consécutives sur les mêmes entrées peuvent différer de 20 % en coût et de 30 % en durée, à cause des itérations d'outils, des reformulations et — en hiérarchique — des décisions du gestionnaire. Une facture prévisionnelle doit inclure une marge d'au moins 30 %.
Les plafonds à surveiller
Trois plafonds structurels peuvent bloquer l'exécution.
Le premier est le contexte cumulé. Chaque appel embarque la consigne système (avec les descriptions d'outils), la description de l'agent, la description de la tâche, le contexte transmis et la mémoire retrouvée. Sur une chaîne de dix tâches avec mémoire, la consigne effective peut approcher la limite du modèle (128 000 jetons pour les grands modèles récents, 32 000 pour d'autres) — la troncature silencieuse commence là.
Le deuxième est le quota d'API de votre compte. Une équipe qui produit 20 appels par exécution atteint vite les 500 ou 1 000 appels par minute autorisés en cas d'exécution parallèle. La limite se signale par des erreurs HTTP 429, et CrewAI les fait remonter sous forme d'exceptions qui font échouer la tâche.
Le troisième est le coût monétaire : le compte peut être plafonné mensuellement chez le fournisseur. Une équipe hiérarchique mal réglée qui boucle peut consommer 50 dollars en une nuit sur un modèle premium — mieux vaut poser un plafond côté fournisseur avant, pas après.
Quand renoncer à une équipe
Trois signes disent qu'il faut renoncer et revenir à un agent unique :
- Le cas d'usage est interactif (chatbot, complétion en édition) : la latence de plusieurs dizaines de secondes est incompatible.
- Le coût unitaire cible est très bas (traitement de masse en flux continu) : l'équipe coûte 5 à 10 fois plus qu'un agent bien consigné.
- La variabilité est inacceptable (générer une facture, un contrat, un identifiant) : l'imprévisibilité d'exécution rend la validation coûteuse.
À l'inverse, une équipe se justifie sur des tâches de production éditoriale, de recherche exploratoire, d'analyse-synthèse-décision — c'est-à-dire des cas où quelques dizaines de secondes et quelques dizaines de centimes sont largement acceptables pour un livrable de meilleure qualité qu'un agent seul.
Une démonstration CrewAI de deux minutes cache la facture derrière la fluidité de la trace. Mesurez toujours avant d'industrialiser : lancez l'équipe cinquante fois sur des entrées réelles, exportez le décompte de jetons via un callback ou via le tableau de bord du fournisseur, et projetez à l'échelle réelle. La surprise financière est le premier motif d'abandon en production.
En résumé
- Une exécution CrewAI produit 12 à 40 appels au LLM selon le processus et les outils — bien plus que le nombre de tâches.
- Sur le fil rouge, la facture d'une exécution va de quelques dizaines de centimes à plusieurs dollars selon les modèles retenus par agent.
- La latence se compte en dizaines de secondes : l'approche multi-agents est asynchrone, pas interactive.
- Trois plafonds à surveiller : contexte cumulé proche de la limite du modèle, quota d'API dépassé, plafond monétaire du compte fournisseur.
Module suivant : déboguer une équipe qui n'aboutit pas.