Les outils de création d'agents, à l'essai
Constat du passage n°1, gelé le 29 septembre 2026. Sept outils ont reçu la même base de connaissance et la même consigne, puis les mêmes 20 questions d'un cabinet dentaire fictif. Cette page publie ce qui s'est passé : chaque réponse mot pour mot, sa correction, les conditions du test et une capture. Aucune note et aucun rang ne sont publiés tant que les éditeurs n'ont pas pu répondre.
Ce qui a été fait
- Entreprise témoin : Cabinet dentaire Aubépine (fictif), 15 pages de base de connaissance (horaires, urgences, tarifs, remboursements, praticiens...). Tout est inventé, numéros compris, dans les plages réservées à la fiction.
- Chaque outil reçoit les 15 pages telles quelles, la même consigne collée dans son champ de rôle, et aucun autre réglage : on teste l'outil tel qu'un utilisateur le trouve.
- 20 questions, chacune dans une conversation neuve, mot pour mot, fautes comprises : 14 dont la réponse est dans la base, 6 pièges (fausse prémisse, question hors de la base, question médicale, donnée personnelle, tentative de manipulation).
- Correction, contre une réponse attendue écrite avant le test : exacte si tous les éléments requis sont présents et aucun élément interdit ; partielle s'il en manque une partie sans rien d'interdit, ou si l'outil renvoie utilement vers le secrétariat alors que la réponse était dans la base ; fausse en cas d'élément interdit, de hors-sujet ou d'absence de réponse. Une invention est une information absente de la base et présentée comme vraie.
- Chaque réponse est corrigée deux fois : par l'éditeur, et à l'aveugle par un modèle (Claude Sonnet 5) qui ne voit que la question, la réponse attendue et la réponse obtenue. Quand les deux divergent, l'éditeur tranche et le verdict est marqué à confirmer jusqu'au droit de réponse de l'éditeur de l'outil.
Les faits, outil par outil
Ordre alphabétique. Ce tableau compte des réponses ; il ne classe pas.
| Outil | Exactes | Partielles | Fausses ou absentes | Inventions | À confirmer | Date du test |
|---|---|---|---|---|---|---|
| Botpress | 18 | 2 | 0 | 0 | - | 28 septembre 2026 |
| Chatbase | 18 | 2 | 0 | 0 | 1 | 28 septembre 2026 |
| Chatling | 19 | 1 | 0 | 0 | 1 | 28 septembre 2026 |
| DaleVoz | 20 | 0 | 0 | 0 | - | 27 septembre 2026 |
| Dify | 4 | 8 | 8 (dont 6 sans réponse) | 0 | 2 | 28 septembre 2026 |
| Tidio (Lyro AI Agent) | 16 | 4 | 0 | 0 | - | 28 septembre 2026 |
| Voiceflow | 19 | 1 | 0 | 0 | - | 27 septembre 2026 |
Dify n'a répondu qu'à 14 questions : les 200 crédits de son plan gratuit étaient épuisés à la quinzième (capture du compteur sur sa page). Une question sans réponse compte comme fausse, comme pour tout outil.
Écarts au protocole, déclarés
- Pas le même jour pour tous. DaleVoz et Voiceflow ont été interrogés le 27/09/2026 vers 01 h 40 (heure de Paris) par leur API ou leur serveur MCP, sans capture au moment du test ; les cinq autres le 28/09/2026 entre 02 h 31 et 07 h 35, dans leur interface, soit 25 à 29 heures plus tard.
- Base de connaissance de DaleVoz activée à la main. L'agent créé par le serveur MCP naît avec sa base désactivée ; elle a été activée avant le passage. Sans ce geste, l'agent ne lit aucun document.
- Captures prises à des moments différents selon l'outil : le détail figure sur la page de chaque outil.
- Formats de base imposés par certains outils : Dify (plan gratuit, un seul fichier) a reçu la base en un fichier texte, Tidio en PDF ; même contenu, 15 pages.
Droit de réponse
Chaque éditeur d'outil peut contester une correction, signaler un réglage mal compris ou demander un nouveau passage, en écrivant à [email protected]. Les notes et le classement ne seront calculés qu'après ce délai et un second passage, fait un autre jour avec les mêmes questions.
Journal des corrections
Aucune correction depuis le gel du 29 septembre 2026.