Preuves · Mesures · Limites
Ce que nous mesurons, et ce que nous ne prouvons pas encore.
Un répondant synthétique ne se juge pas sur une démonstration. Cette page rassemble nos cas d’usage, publiés de bout en bout, puis ce que nous avons mesuré, face à quoi, et ce qui reste à prouver. Elle est mise à jour à chaque nouvelle étude et à chaque nouvelle mesure.
Cas d'usage
Des études réelles, publiées de bout en bout : la question posée, le dispositif, ce qu'on obtient, et ce que cela permet de dire. De quoi voir comment cela marche avant d'essayer. Chaque cas montre :
- la décision en jeu et la question posée ;
- qui est interrogé, comment, et combien de temps a duré le terrain ;
- ce qu'on obtient : thèmes, désaccords, verbatims, et un entretien lu en entier ;
- ce que l'étude permet de dire, ce qu'elle ne permet pas, et comment demander le rapport complet.
- Cas d’usage : vingt entretiens individuels avec des personas synthétiques sur leur propre place dans les études
Une étude qualitative exploratoire, publiée de bout en bout : la question posée, le panel de vingt profils, le dispositif, les thèmes, les désaccords, les verbatims et un entretien lu en entier. Puis ce que l’étude permet de dire, et ce qu’elle ne permet pas.
Ce que ces preuves permettent de décider
Vous pouvez vous en servir pour
- comparer et classer des concepts, des messages ou des noms avant le terrain, puis réserver le terrain aux meilleurs ;
- repérer tôt les objections et les points de désaccord d'une cible ;
- exiger d'un fournisseur, nous compris, les mêmes mesures face à une enquête publique.
Pas pour
- remplacer une mesure auprès de vraies personnes quand la décision engage beaucoup ;
- trancher sur une opinion minoritaire ou une catégorie vraiment nouvelle ;
- tenir pour acquis que les réponses sont justes sur des questions nouvelles : ce test n'est pas encore lancé.
Ce que nous mesurons
Le défaut le plus courant des répondants synthétiques ne se voit pas dans les moyennes : ils sont trop d'accord entre eux. Nous mesurons donc la dispersion des réponses, comparée à celle de vraies personnes du même profil. À 1,00, le désaccord est le même que chez les humains.
Dans huit marchés, nos répondants simulés montraient 0,20 à 0,76 de la dispersion humaine avant correction. Après correction : 0,96 à 1,07 sur les attitudes, 0,85 à 1,00 sur la personnalité.
- Les répondants synthétiques sont-ils fiables ? Nos chiffres, huit marchés — La note complète, marché par marché.
- Sous-dispersion — Le défaut, défini et mesurable.
- Under-dispersion, and what we did about it — Le défaut publié avant sa correction (en anglais).
Face à quoi
Toujours face à des enquêtes auprès de vraies personnes, jamais face à un modèle. La vague 11 de l'European Social Survey pour la France, le Royaume-Uni, l'Allemagne, l'Italie et l'Espagne. Le World Values Survey pour les États-Unis et le Mexique. Une enquête nationale de 1 016 répondants réalisée par Insights House pour le Maroc. Twin-2K-500, 2 058 répondants américains, pour la personnalité.
Chaque correction a été vérifiée sur cinq répétitions de dix mille profils générés. Nous publions ce face à quoi nous mesurons et ce que nous mesurons ; nous ne publions pas la façon dont la correction fonctionne.
Ce que nous ne prouvons pas encore
C'est une calibration, pas une validation : le banc hors échantillon, avec des questions nouvelles, est pré-enregistré et n'a pas encore été lancé.
La référence a sa propre marge d'erreur : sur le marché américain, environ ±0,02.
Un marché n'a pas de contrôle indépendant : le Mexique repose sur une seule enquête.
Notre indice de fiabilité ne note pas encore la dispersion, et nous ne publions donc aucun intervalle de confiance tiré de notre variance.
Ce que vous pouvez vérifier vous-même
Une mesure qu'on ne peut pas refaire ne vaut pas grand-chose. Nous publions la méthode du test, et les questions qu'un acheteur peut poser à tout fournisseur, nous compris.
- Under-dispersion, and a test anyone can run — Le test, sur des données publiques, sans frais (en anglais).
- Calibration, and what a buyer can check — Ce qu'un fournisseur devrait pouvoir montrer (en anglais).
- Comment marche une étude synthétique — Les huit étapes, de la décision à la lecture, et les contrôles.
- Répondant synthétique — Définition, fiabilité, cadre et vérifications avant d'acheter.
Nos engagements publics
Nous répondons en public aux 20 questions d'Esomar pour les acheteurs de services fondés sur l'IA, y compris à celles auxquelles nous ne savons pas encore répondre. Le code international ICC/Esomar, révisé en 2025, impose de dire au client quand des données ou des personas synthétiques sont utilisés : nous l'appliquons. Et nous acceptons les tests en parallèle, à l'aveugle, publiés quel qu'en soit le résultat.
Pour proposer un test en parallèle, discuter d'une mesure ou nous contredire.
Écrire à FlashInsight