Glossaire
Répondant synthétique
Aussi appelé synthetic respondent · répondant simulé
Un modèle interrogé comme on interrogerait une personne, calibré à partir de données décrivant une population réelle. La sortie — l’unité dont un échantillon est composé.
Un répondant synthétique est la sortie de la chaîne : l’ensemble des réponses qu’un modèle de langage produit quand on lui donne un persona, c’est-à-dire un briefing qui décrit qui répond, ancré sur les données d’une population réelle. Ce n’est pas la simulation d’une personne. C’est un objet statistique, et la seule qualité qui compte est la fidélité de la distribution de ses réponses à celle de vrais répondants du même profil.
L’essentiel
- La donnée synthétique est ce qui entre, le persona est le briefing, le répondant est ce qui parle. Un échantillon synthétique est composé de répondants, pas de personas.
- Il reproduit des régularités d’ensemble, préférences, écarts entre segments, orientations d’attitude, et non une vérité individuelle.
- Sa fiabilité a deux faces : la justesse des moyennes, que presque tout le monde annonce, et la dispersion des réponses, que presque personne ne mesure. C’est la seconde qui décide si deux options peuvent être comparées.
- Nous publions nos propres chiffres de dispersion, sur huit marchés, avant et après correction, mesurés contre des enquêtes nationales.
- Il propose, le terrain tranche. C’est un étage intermédiaire entre l’intuition et la mesure, pas un remplaçant de la mesure.
Comment fonctionne un répondant synthétique ?
Par une chaîne en trois temps. Une population est d’abord construite à partir de données publiques, statistique officielle et grandes enquêtes sociales, pour que ses profils soient distribués comme dans la population réelle visée. Dans cette population, on tire des personas, chacun décrivant un individu plausible par ses caractéristiques, ses attitudes et ses traits. Chaque persona est enfin donné au modèle, qui répond au questionnaire ou au guide d’entretien dans ce cadre. Une étude quantitative en interroge de cinquante à cinq cents ; un focus group synthétique en réunit une dizaine au plus.
La comparaison la plus juste reste celle du simulateur de vol : personne n’y monte en croyant prendre l’avion, et personne ne lui reproche de ne pas voler. Il reproduit fidèlement certaines lois, ce qui suffit à tester avant d’engager.
Un répondant synthétique est-il fiable ? Ce que nous avons mesuré
Sur les moyennes, souvent oui. Sur la dispersion, souvent non, et c’est là que se joue la décision. Un chiffre d’exactitude dit à quelle distance une moyenne simulée atterrit d’une moyenne humaine, sur des questions dont on connaissait déjà la réponse. Il ne dit rien de l’étalement : à l’intérieur d’un groupe de personnes qui se ressemblent sur le papier, les répondants simulés se contredisent-ils autant que de vraies personnes ?
Nous avons mesuré ce rapport sur huit marchés, France, Royaume-Uni, Allemagne, Italie, Espagne, États-Unis, Mexique et Maroc, contre des enquêtes nationales : la vague 11 de l’European Social Survey pour l’Europe, la World Values Survey pour les États-Unis et le Mexique, une enquête nationale de 1 016 répondants pour le Maroc. Avant correction, nos répondants simulés se situaient entre 0,20 et 0,76 de la dispersion humaine, selon le marché. Après correction, entre 0,96 et 1,07 sur les attitudes, et entre 0,85 et 1,00 sur la couche de personnalité, vérifiée contre Twin-2K-500, un jeu public de 2 058 répondants américains. Aucune de ces corrections n’a déplacé une seule moyenne. Les chiffres complets, marché par marché, sont dans la note qui les publie, en anglais.
Ce que cela ne prouve pas, nous le disons aussi : c’est une calibration, pas une validation. Faire coïncider un moteur avec les enquêtes sur lesquelles il a été réglé est une affirmation plus faible que de le tester sur des questions jamais vues. Ce test hors échantillon est préenregistré et n’a pas encore été passé.
Un répondant synthétique est-il un faux répondant ?
La question est mal posée. Un répondant synthétique n’est ni vrai ni faux, il est plus ou moins fidèle, et cette fidélité se mesure. La question utile porte sur la fiabilité de l’instrument après validation, pas sur son réalisme : un persona très vivant peut se tromper exactement là où la décision se joue, et un profil sobre peut reproduire au centième près la structure d’une population. Ce n’est pas non plus un substitut au terrain. Le synthétique sert à explorer avant d’engager ; la mesure sur de vraies personnes reste ce qui tranche.
Quel cadre s’applique : RGPD, code ICC/Esomar, 20 questions d’Esomar ?
Le code international ICC/Esomar, révisé en 2025. Sa cinquième édition, approuvée en juin 2025 et qui remplace celle de 2016, définit pour la première fois la donnée synthétique et le persona synthétique. Trois règles concernent directement les répondants synthétiques. Le client doit être informé quand l’IA, des données synthétiques ou des personas synthétiques servent à constituer les données, à les analyser ou à les interpréter, et le niveau de supervision humaine doit être indiqué (article 7). Les résultats publiés doivent dire si ces techniques ont joué un rôle important, et avec quelle supervision (article 9). Et un persona synthétique utilisé pour interroger de vraies personnes doit être annoncé dès le début (article 4). Le texte est en ligne sur le site d’Esomar.
Les 20 questions d’Esomar. Publiées en 2024, elles aident l’acheteur de services fondés sur l’IA à interroger un fournisseur : ce que fait le système, sur quelles données, avec quelle transparence et quelle gouvernance. Nous y avons répondu en public, y compris aux questions auxquelles nous ne savons pas encore répondre. Esomar les a complétées en 2025 par cinq sujets de discussion propres aux données synthétiques augmentées.
Le RGPD. Un répondant synthétique ne décrit aucune personne réelle. Le RGPD s’applique en revanche aux données personnelles qui servent à construire ou à tester le système, et à celles que le client transmet pour une étude. Nos calibrations reposent sur des enquêtes nationales anonymisées, nommées dans notre note sur la fiabilité.
Que vérifier avant d’acheter ?
Cinq questions suffisent, et une réponse manquante est une réponse.
- Sur quelle enquête publique chaque marché est-il calibré ? Le nom et la vague, pas « des données propriétaires ».
- Quel est le rapport de dispersion, marché par marché, avant et après correction ? Un fournisseur qui l’a mesuré vous le montrera. Un fournisseur qui n’a jamais regardé vous le dira aussi.
- Les questions qui ont servi au test ont-elles été vues pendant la calibration ? Si oui, le chiffre décrit un ajustement, pas une capacité à prédire.
- Quels marchés disposent d’un second contrôle indépendant, et lesquels reposent sur une seule enquête ?
- Le fournisseur répond-il aux 20 questions d’Esomar en entier, ou seulement à celles qui l’arrangent ? Et accepte-t-il un test en parallèle, à l’aveugle, publié quel qu’en soit le résultat ?
Un panel synthétique mal construit est trop d’accord avec lui-même, et c’est mesurable. C’est par là qu’il faut commencer.
Questions fréquentes
Qu’est-ce qu’un répondant synthétique ?
C’est l’ensemble des réponses qu’un modèle de langage produit quand on lui donne un persona, c’est-à-dire un briefing décrivant qui répond, ancré sur les données d’une population réelle. Ce n’est pas la copie d’une personne : c’est un objet statistique, dont la seule qualité qui compte est la fidélité de la distribution de ses réponses à celle de vrais répondants.
Quelle différence entre un persona synthétique et un répondant synthétique ?
Le persona est l’entrée : la spécification donnée au modèle. Le répondant est la sortie : ce que le modèle répond une fois ce cadre posé. Le marché confond souvent les deux. La distinction compte parce qu’on ne vérifie pas la même chose sur l’un et sur l’autre : l’origine du profil pour le persona, la dispersion des réponses pour le répondant.
Les répondants synthétiques sont-ils fiables ?
Sur les moyennes, souvent oui après calibration. Sur la dispersion, souvent non : avant correction, nos répondants simulés ne montraient que 0,20 à 0,76 de la dispersion de vrais répondants du même profil, sur huit marchés : ils se ressemblaient trop. Après correction, ils sont entre 0,96 et 1,07 de la dispersion humaine sur les attitudes. Un fournisseur qui n’annonce qu’un pourcentage d’exactitude ne répond pas à la question.
Un répondant synthétique peut-il remplacer un vrai répondant ?
Non. Il sert avant le terrain : classer et filtrer des concepts, des messages, des stimuli, pour que moins d’idées, et de meilleures, arrivent en test réel. Il ne remplace pas une mesure quand l’enjeu est une opinion minoritaire, une catégorie vraiment nouvelle ou une décision qui ne sera pas vérifiée ensuite auprès de personnes réelles.
Comment tester un fournisseur de répondants synthétiques ?
Demandez trois choses. Sur quelle enquête publique chaque marché est calibré, en la nommant et en datant la vague. Si les questions qui ont servi à tester le système ont été vues pendant sa calibration ; si oui, le chiffre décrit un ajustement, pas une capacité à prédire. Et quel est le rapport de dispersion, marché par marché, avant et après correction.
Quel cadre s’applique aux répondants synthétiques : RGPD, code ICC/Esomar, 20 questions d’Esomar ?
Le code international ICC/Esomar, révisé en 2025, définit les données et les personas synthétiques et impose de dire au client quand ils sont utilisés, avec le niveau de supervision humaine, et de le déclarer dans les résultats publiés. Les 20 questions d’Esomar, publiées en 2024, aident l’acheteur à interroger un fournisseur de services d’IA. Le RGPD s’applique aux données personnelles qui servent à construire ou à tester le système, et à celles que le client transmet.
Voir aussi
- Donnée synthétique — Une donnée générée artificiellement qui reproduit les propriétés statistiques de données réelles sans contenir d’information personnelle. La matière première — pas le répondant.
- Persona synthétique — Le briefing donné au modèle : l’ensemble des traits, attitudes et caractéristiques qui orientent ses réponses. Une spécification, pas une personne.
- Sous-dispersion — Le défaut le plus fréquent des panels simulés : les réponses sont plus resserrées que celles d’humains réels. Le désaccord disparaît, et avec lui le signal.
À lire
- Les répondants synthétiques sont-ils fiables ? Nos chiffres, huit marchésBlog FlashInsight
- Personas synthétiques : peuvent-ils remplacer les répondants ?Blog FlashInsight
- How reliable are synthetic respondents? Our own numbers, eight marketsBlog FlashInsight · en anglais
- Notre méthodeFlashInsight
- Écrits — tribunes, articles, rechercheFlashInsight
- « Un répondant synthétique = un faux répondant ? »MR News