Preuves · Mesures · Limites

Ce que nous mesurons, et ce que nous ne prouvons pas encore.

Un répondant synthétique ne se juge pas sur une démonstration. Cette page rassemble nos cas d’usage, publiés de bout en bout, puis ce que nous avons mesuré, face à quoi, et ce qui reste à prouver. Elle est mise à jour à chaque nouvelle étude et à chaque nouvelle mesure.

Cas d'usage

Des études réelles, publiées de bout en bout : la question posée, le dispositif, ce qu'on obtient, et ce que cela permet de dire. De quoi voir comment cela marche avant d'essayer. Chaque cas montre :

  • la décision en jeu et la question posée ;
  • qui est interrogé, comment, et combien de temps a duré le terrain ;
  • ce qu'on obtient : thèmes, désaccords, verbatims, et un entretien lu en entier ;
  • ce que l'étude permet de dire, ce qu'elle ne permet pas, et comment demander le rapport complet.

Ce que ces preuves permettent de décider

Vous pouvez vous en servir pour

  • comparer et classer des concepts, des messages ou des noms avant le terrain, puis réserver le terrain aux meilleurs ;
  • repérer tôt les objections et les points de désaccord d'une cible ;
  • exiger d'un fournisseur, nous compris, les mêmes mesures face à une enquête publique.

Pas pour

  • remplacer une mesure auprès de vraies personnes quand la décision engage beaucoup ;
  • trancher sur une opinion minoritaire ou une catégorie vraiment nouvelle ;
  • tenir pour acquis que les réponses sont justes sur des questions nouvelles : ce test n'est pas encore lancé.

Ce que nous mesurons

Le défaut le plus courant des répondants synthétiques ne se voit pas dans les moyennes : ils sont trop d'accord entre eux. Nous mesurons donc la dispersion des réponses, comparée à celle de vraies personnes du même profil. À 1,00, le désaccord est le même que chez les humains.

Dans huit marchés, nos répondants simulés montraient 0,20 à 0,76 de la dispersion humaine avant correction. Après correction : 0,96 à 1,07 sur les attitudes, 0,85 à 1,00 sur la personnalité.

Face à quoi

Toujours face à des enquêtes auprès de vraies personnes, jamais face à un modèle. La vague 11 de l'European Social Survey pour la France, le Royaume-Uni, l'Allemagne, l'Italie et l'Espagne. Le World Values Survey pour les États-Unis et le Mexique. Une enquête nationale de 1 016 répondants réalisée par Insights House pour le Maroc. Twin-2K-500, 2 058 répondants américains, pour la personnalité.

Chaque correction a été vérifiée sur cinq répétitions de dix mille profils générés. Nous publions ce face à quoi nous mesurons et ce que nous mesurons ; nous ne publions pas la façon dont la correction fonctionne.

Ouvrir l’animation en plein écran

Ce que nous ne prouvons pas encore

C'est une calibration, pas une validation : le banc hors échantillon, avec des questions nouvelles, est pré-enregistré et n'a pas encore été lancé.

La référence a sa propre marge d'erreur : sur le marché américain, environ ±0,02.

Un marché n'a pas de contrôle indépendant : le Mexique repose sur une seule enquête.

Notre indice de fiabilité ne note pas encore la dispersion, et nous ne publions donc aucun intervalle de confiance tiré de notre variance.

Ouvrir l’animation en plein écran

Ce que vous pouvez vérifier vous-même

Une mesure qu'on ne peut pas refaire ne vaut pas grand-chose. Nous publions la méthode du test, et les questions qu'un acheteur peut poser à tout fournisseur, nous compris.

Nos engagements publics

Nous répondons en public aux 20 questions d'Esomar pour les acheteurs de services fondés sur l'IA, y compris à celles auxquelles nous ne savons pas encore répondre. Le code international ICC/Esomar, révisé en 2025, impose de dire au client quand des données ou des personas synthétiques sont utilisés : nous l'appliquons. Et nous acceptons les tests en parallèle, à l'aveugle, publiés quel qu'en soit le résultat.

Pour proposer un test en parallèle, discuter d'une mesure ou nous contredire.

Écrire à FlashInsight