Comment évaluer une agence de développement d'agents IA
Ce qui distingue un système en production, stateful et testé pour la résilience, d'une démo qui a fonctionné une fois : le tout chiffré à la tâche, pas à la slide.
L'écart qu'on évalue
Ce qu'on vend aujourd'hui sous le nom d'agent IA est souvent un chatbot avec quelques outils branchés, présenté dans une démo qui n'a tourné qu'une fois pour le rendez-vous commercial. L'écart entre ça et un système qui tourne sans supervision en production, sur des entrées réelles, c'est là qu'une agence justifie son tarif ou pas. Cette page réunit ce qu'on voudrait savoir avant d'en embaucher une : comment reconnaître un graphe stateful d'une chaîne de prompts, ce que coûte le travail au niveau de la tâche, et quoi demander avant de signer.
Questions à poser avant de signer
Demandez à voir le graphe, pas une slide
Un système d'agents en production est un graphe d'états : nœuds typés, routage conditionnel, checkpointing. Si le seul livrable qu'une agence peut montrer est un deck ou une vidéo de démo, il n'y a pas de graphe derrière, juste une suite de prompts.
Demandez ce qui se passe en cas de timeout
Que fait le système en cas de timeout du modèle, de sortie mal formée, ou de panne d'une API tierce ? Une réponse vague signifie qu'il n'a été testé que contre le cas nominal.
Demandez qui valide les actions irréversibles
Envoyer un email, écrire dans l'ERP, déclencher un paiement : demandez lesquelles de ces actions l'agent peut déclencher seul, et où se situe le point de contrôle humain avant qu'il agisse.
Demandez ce que coûte une exécution
Demandez un coût par exécution ou par tâche, pas une estimation mensuelle. Une agence qui ne suit pas le coût par nœud ne l'optimise pas non plus, et la facture vous surprendra plus tard.
Demandez le tarif, pas une fourchette vague
Demandez le tarif jour et comment la fourchette de devis est construite. Une agence qui refuse de publier un tarif fixe un prix pour le client, pas pour le projet.
Demandez qui est appelé en cas d'incident
Demandez le runbook : ce qui déclenche une alerte, à quoi ressemble le rollback, et qui prend le relais quand le pipeline tombe en production.
Ce que ça coûte
Notre propre tarif, publié plutôt que communiqué au cas par cas. C'est le chiffre sur lequel se construit chaque estimation de ce site.
Le détail du travail, tâche par tâche
On chiffre à partir d'un modèle tâche par tâche plutôt qu'au feeling : 58 tâches, de l'atelier de lancement aux tests end-to-end et au monitoring des exécutions, chacune avec une estimation découpée en minutes agent et minutes humaines. Sur ces 58 tâches, le modèle situe le temps agent à 1 250 minutes contre 4 615 minutes de temps humain typique, soit environ un quart. À dire clairement : ce sont nos propres estimations, pas des moyennes mesurées sur des projets livrés, et les colonnes de calibration sont encore vides. Ce que montre le découpage, c'est la forme du travail, pas un multiplicateur de productivité. L'atelier de lancement est à 0 minute agent par construction, parce qu'aucun agent ne mène un atelier de cadrage. Ce qui se compresse, c'est la construction, pas le jugement.
Pilote mort, ou système en production
Signes d'un pilote mort
- Fonctionne une fois, dans une démo scénarisée, et casse à la première entrée un peu sale.
- Aucun état : chaque exécution repart de zéro, sans mémoire d'un tour précédent ni d'un échec précédent.
- Le succès a été mesuré une fois, au rendez-vous commercial, jamais revérifié depuis.
- Aucune réponse sur ce qui se passe en cas de timeout du LLM ou de sortie mal formée.
- Aucun chiffre de coût ou de latence par exécution, parce que personne ne suit ni l'un ni l'autre.
Signes d'un système en production
- Un graphe stateful : état typé, routage conditionnel, checkpointing qui reprend après un crash.
- Testé pour la résilience : timeouts, sorties mal formées et pannes d'API simulés avant le lancement, pas découverts par un client.
- Monitoré : traces par nœud, coût par exécution, un SLA avec un chiffre dessus.
- Un runbook : qui est appelé, à quoi ressemble le rollback, quand un humain reprend la main.
- Une frontière posée : quelles actions l'agent déclenche seul, lesquelles demandent une validation humaine d'abord.
Questions qu'on nous pose
Que construit vraiment une agence de développement d'agents IA ?
Un graphe d'agents branché sur un processus réel : des nœuds qui appellent un LLM ou un outil, un état typé qui circule entre eux, un routage conditionnel, et des garde-fous avant toute action externe. Pas un chatbot, et pas un workflow qui ne gère que les cas montrés en démo.
Combien coûte une agence de développement d'agents IA ?
La nôtre est facturée 600 € la journée, ou 2 500 € la semaine au forfait, et les mêmes chiffres valent en dollars (600 $ / 2 500 $) : un choix commercial assumé, pas une conversion de change. Le devis se construit à partir des semaines estimées multipliées par ce tarif semaine, puis une fourchette ×1,4 pour couvrir une dérive de périmètre. Le chiffre exact dépend du nombre de nœuds, d'intégrations et de cas de résilience que le processus exige.
Combien de temps pour passer du pilote à la production ?
Ça dépend du processus, pas d'un gabarit fixe : une automatisation à un seul nœud avec une intégration se compte en semaines ; un graphe multi-agents avec plusieurs systèmes externes et des actions irréversibles prend plus de temps, parce que la phase de tests de résilience ne peut pas être sautée.
Quelle est la différence entre un agent IA et un chatbot avec des outils ?
L'état et les tests. Un chatbot avec des outils appelle une fonction et répond ; un graphe d'agents garde un état typé entre les étapes, route selon ce qui s'est passé, et a été testé contre les timeouts, les mauvaises sorties et les pannes avant de tourner sans supervision.
Pouvez-vous reprendre un pilote existant plutôt que repartir de zéro ?
Oui. Ce qui manque le plus souvent à un pilote qui fonctionne, c'est l'état, les tests de résilience et le monitoring : c'est là que se concentre le travail. La phase de cartographie part de l'existant plutôt que de tout refaire.
Que se passe-t-il après le lancement ?
Les traces Langfuse montrent quels nœuds échouent ou sont les plus lents, et chaque cycle produit une version de prompt améliorée. Les nœuds aux sorties stables migrent vers un modèle moins cher. Le pipeline est censé continuer à s'améliorer après le premier déploiement, pas être livré puis oublié.
Et ensuite
Développement d'agents IA sur mesure
la page de service, si vous connaissez déjà le processus à construire
Experts IA en régie, intégrés à votre équipe
du renfort d'équipe plutôt qu'une livraison à périmètre fixe
Ce que coûte vraiment une flotte d'agents
nos propres mesures de temps et de tokens, un autre angle sur la même question
Prêt à arrêter de deviner et à cadrer le projet ?
Décrivez le processus à automatiser. On vous dit ce que ça prend vraiment.
Décrire mon projet →