Baromètre des agences IA
● Comparatif d'outils · passage n°1 gelé le 30 septembre 2026 · aucune note ni rang avant le droit de réponse des éditeurs (calendrier)

Passage n°1 · constat gelé le 30 septembre 2026

Comment les chatbots IA sont testés

Même base, même consigne, mêmes questions pour tous, chaque réponse corrigée deux fois, et tout écart au protocole déclaré.

Ce qui a été fait

  • Entreprise témoin : Cabinet dentaire Aubépine (fictif), 15 pages de base de connaissance (horaires, urgences, tarifs, remboursements, praticiens...). Tout est inventé, numéros compris, dans les plages réservées à la fiction.
  • Chaque outil reçoit les 15 pages telles quelles, la même consigne collée dans son champ de rôle, et aucun autre réglage : on teste l'outil tel qu'un utilisateur le trouve.
  • 20 questions, chacune dans une conversation neuve, mot pour mot, fautes comprises : 14 dont la réponse est dans la base, 6 pièges (fausse prémisse, question hors de la base, question médicale, donnée personnelle, tentative de manipulation).
  • Correction, contre une réponse attendue écrite avant le test : exacte si tous les éléments requis sont présents et aucun élément interdit ; partielle s'il en manque une partie sans rien d'interdit, ou si l'outil renvoie utilement vers le secrétariat alors que la réponse était dans la base ; fausse en cas d'élément interdit, de hors-sujet ou d'absence de réponse. Une invention est une information absente de la base et présentée comme vraie.
  • Lien d'édition. DaleVoz est édité par Corentin Hualpa, qui publie aussi ce baromètre. Il est testé avec la même méthode, les mêmes questions et la même correction que les autres outils.
  • Chaque réponse est corrigée deux fois : par l'éditeur, et à l'aveugle par un modèle Claude (Sonnet 5 ; Sonnet 5.5 pour Freshchat, Intercom, Lime Connect et Zendesk) qui ne voit que la question, la réponse attendue et la réponse obtenue. Quand les deux divergent, l'éditeur tranche et le verdict est marqué à confirmer jusqu'au droit de réponse de l'éditeur de l'outil.
  • Fonctions déclarées (onglet Fonctions) : le 4 octobre 2026, 21 critères relevés dans la documentation publique de chaque éditeur (API, MCP, assistant IA, base de connaissance, canaux, données personnelles), chacun avec une citation copiée mot pour mot et une copie datée de la page ; un script vérifie que chaque citation figure bien dans la page archivée. Une fonction que la documentation n'établit pas pour le produit testé est « non documentée », jamais « non » ; une fonction qui existe sans être ouverte à tous est en « accès restreint ». Ce sont des déclarations : elles n'entrent dans aucun verdict. La prise en main chronométrée et une base de connaissance difficile (PDF scanné, tableau) seront mesurées au second passage.
  • La recherche de l'onglet Trouver passe par un modèle d'IA (Claude) qui traduit la demande en critères choisis dans une liste fermée ; la réponse est calculée sur les seules données du test, sans note ni gagnant. Sans réponse du modèle, des mots-clés prennent le relais.

Écarts au protocole, déclarés

  • Pas le même jour pour tous. DaleVoz et Voiceflow ont été interrogés le 27/09/2026 vers 01 h 40 (heure de Paris) par leur API ou leur serveur MCP, sans capture au moment du test ; Botpress, Chatbase, Chatling, Dify et Tidio le 28/09/2026 dans leur interface ; les suivants le 30/09/2026. La date de chaque passage figure sur la page de chaque outil et au survol de son nom dans la grille.
  • Base de connaissance de DaleVoz activée à la main. L'agent créé par le serveur MCP naît avec sa base désactivée ; elle a été activée avant le passage. Sans ce geste, l'agent ne lit aucun document.
  • Captures prises à des moments différents selon l'outil : le détail figure sur la page de chaque outil.
  • Formats de base imposés par certains outils : Dify (plan gratuit, un seul fichier) a reçu la base en un fichier texte, Tidio en PDF ; même contenu, 15 pages.

Droit de réponse

Chaque éditeur d'outil peut contester une correction, signaler un réglage mal compris ou demander un nouveau passage, en écrivant à [email protected]. Les notes et le classement ne seront calculés qu'après ce délai et un second passage, fait un autre jour avec les mêmes questions.

Journal des corrections

Aucune correction depuis le gel du 30 septembre 2026.

Mis à jour le 4 octobre 2026 · par Corentin Hualpa, éditeur du baromètre (indépendance et lien d'édition) · données brutes