Glossaire

Donnée synthétique

Aussi appelé données synthétiques · synthetic data

Une donnée générée artificiellement qui reproduit les propriétés statistiques de données réelles sans contenir d’information personnelle. La matière première — pas le répondant.

Une donnée synthétique est produite par un modèle plutôt que collectée auprès d’une personne. Elle est construite pour conserver les régularités statistiques d’un jeu de données réel, distributions, corrélations, structure des sous-groupes, sans reproduire aucune ligne individuelle identifiable. En études de marché, c’est la matière première d’une population interrogeable. Ce n’est pas le répondant, et la confusion entre les deux est l’erreur de vocabulaire la plus répandue du marché.

L’essentiel

  • « Synthétique » est un statut, pas un usage : la même donnée sert à compléter, à protéger ou à construire une population interrogeable. Seul le troisième usage relève des études.
  • La donnée est l’entrée ; le répondant est la sortie. Une propriété vérifiée sur l’entrée ne garantit rien sur la sortie.
  • La valeur d’une donnée synthétique tient aux propriétés qu’elle conserve, et surtout à celles qui ont été mesurées après génération.
  • Par construction elle ne contient pas de données personnelles ; la garantie dépend de la méthode, pas du mot.

À quoi servent les données synthétiques en études de marché ?

À trois choses très différentes, qu’il faut nommer séparément. Compléter un jeu de données incomplet, par exemple une cible rare que le terrain n’atteint pas en nombre suffisant. Protéger un jeu de données sensible, en le remplaçant par un équivalent statistique sans personne dedans. Et nourrir la construction d’une population synthétique, c’est-à-dire un ensemble de profils distribués comme la population réelle visée, dans laquelle on tirera ensuite des personas à interroger. C’est ce troisième usage qui permet de pré-tester un concept, une publicité ou un nom avant d’engager un budget : tester plus, itérer plus, se tromper plus tôt.

Quelle différence entre donnée, persona et répondant synthétiques ?

Une chaîne, avec un objet distinct à chaque maillon. La donnée synthétique décrit : elle porte les distributions et les corrélations d’une population. Le persona synthétique spécifie : c’est le briefing d’un individu plausible tiré dans cette population. Le répondant synthétique parle : c’est ce que le modèle répond une fois ce briefing posé. Le glissement de l’un à l’autre n’est pas anodin. Il laisse croire qu’une propriété statistique vérifiée sur la matière première vaut garantie sur la réponse produite, alors que chaque maillon peut perdre de l’information, et que le dernier en perd le plus.

Les données synthétiques sont-elles fiables ?

Elles le sont exactement autant que ce qui a été mesuré après génération, ni plus ni moins. Une méthode de génération décrit une intention : conserver telle distribution, telle corrélation. Seule une mesure dit ce qui a été conservé et ce qui a été perdu. Le défaut le plus fréquent en bout de chaîne est la sous-dispersion : les réponses produites sont plus resserrées que celles de vrais répondants, les moyennes restent justes et les comparaisons entre options sont faussées. Nous la mesurons marché par marché contre des enquêtes publiques nommées, et nous publions les écarts, y compris quand ils sont mauvais. La calibration est ce qui rapproche la population générée de sa référence ; elle ne vaut pas validation sur des questions jamais vues.

Que vérifier avant d’acheter ?

Trois questions suffisent.

  • Sur quelles données réelles la génération s’appuie-t-elle, et sont-elles publiques ou propriétaires ? Une source publique se vérifie ; une source propriétaire se croit.
  • Quelles propriétés statistiques ont été conservées, et lesquelles ont été perdues ? Un fournisseur qui n’a rien perdu n’a rien mesuré.
  • Ces propriétés ont-elles été mesurées après génération, ou seulement visées ? Un fournisseur qui décrit sa méthode sans produire d’écart mesuré décrit une intention.

Notre méthode expose ce que nous mesurons, et contre quoi.

Questions fréquentes

Qu’est-ce qu’une donnée synthétique ?

Une donnée produite par un modèle plutôt que collectée auprès d’une personne, construite pour conserver les propriétés statistiques d’un jeu de données réel, distributions, corrélations, structure des sous-groupes, sans reproduire aucune ligne individuelle. En études de marché, c’est la matière première d’une population interrogeable, pas le répondant.

Les données synthétiques contiennent-elles des données personnelles ?

Par construction, non : elles décrivent des régularités d’ensemble, pas des individus, et aucune ligne ne correspond à une personne réelle. C’est même l’un de leurs trois usages, remplacer un jeu de données sensible. Mais la garantie tient à la méthode de génération, pas au mot « synthétique » : demandez au fournisseur comment il s’assure qu’aucun enregistrement réel n’est reproduit.

Quelle différence entre données synthétiques et répondants synthétiques ?

La donnée est ce qui entre, le répondant est ce qui parle. Une donnée synthétique décrit une population ; elle ne répond à rien. Le répondant synthétique est produit à partir d’un persona tiré de cette population et interrogé par un modèle. Une propriété statistique vérifiée sur la matière première ne vaut pas garantie sur les réponses produites ensuite.

Une donnée synthétique peut-elle remplacer une enquête ?

Non. Elle sert à construire un dispositif d’exploration qui précède l’enquête : tester plus de concepts, de messages ou de noms avant d’engager un budget de terrain. Elle permet de simuler ; seule une mesure auprès de personnes réelles permet de trancher. Le synthétique propose, le terrain dispose.

Sur quelles données réelles une population synthétique s’appuie-t-elle ?

Chez FlashInsight, sur la statistique officielle et les grandes enquêtes sociales publiques : Insee, US Census, Eurostat, European Social Survey, World Values Survey, et pour le Maroc une enquête nationale de 1 016 répondants. Chaque marché est calibré contre une enquête nommée, et l’écart entre la population générée et cette référence est mesuré, pas seulement visé.

Voir aussi

  • Répondant synthétique — Un modèle interrogé comme on interrogerait une personne, calibré à partir de données décrivant une population réelle. La sortie — l’unité dont un échantillon est composé.
  • Population synthétique — L’ensemble généré pris comme un tout, construit pour respecter les marges statistiques connues d’un territoire. Le terme vient de la microsimulation, pas des études.
  • Calibration — L’opération qui rattache une population générée à des données réelles observées, et la mesure de l’écart qui subsiste une fois l’opération faite.

À lire

Retour au glossaire