Et si on n'avait plus besoin d'interroger de vrais clients ?

Un street artist peint à la bombe une courbe ascendante gravie par de petites silhouettes, la dernière s'envole avec un ballon rouge
Recherche utilisateur
Date 2 juin 2026
Temps de lecture 9 minutes
Auteur Sami Lini

Intro

Le tsunami de l'IA arrive, et toute l'industrie du numérique se transforme radicalement. Des IA qui remplacent les designers, les researchers, les chefs de projet. Et bien sûr s'est posée très vite la question de remplacer les utilisateurs eux-mêmes pour les études. Des IA utilisées pour simuler des utilisateurs faisant des tests. Mais est-ce que ça fonctionne, si on essaie de remplacer les vrais gens par des IA, quand on les met devant un vrai questionnaire ? Spoiler : « bof, pas trop ».

Quand NVIDIA a annoncé Nemotron, une base de « personas synthétiques », on s’est douté que nos clients viendraient assez vite nous demander si cette technologie, ou une autre, pouvait remplacer des utilisateurs réels. Des clients, dans des secteurs très différents, nous le demandent déjà. Ils voudraient utiliser les modélisations qu’ils ont, ou qu’ils espèrent faire produire, pour simuler des comportements avec une IA. D’ailleurs, dès les toutes premières versions de ChatGPT, vers 2023, il y avait des tests qui vocalisaient des comportements. La première réaction de la plupart des clients à qui on les a montrés, c’était : « Ah c’est super, on n’aura plus besoin d’aller interroger les utilisateurs, les consommateurs, les clients, peu importe comment on les appelle. On aura juste à demander à ChatGPT de faire l’acteur et à lui poser nos questions directement. » Nos concurrents s’y intéressent aussi, on l’a encore constaté récemment, et regardent s’il serait envisageable de simuler des entretiens individuels ou des tests utilisateurs.

Quand on a lancé l’étude, en mars 2026, on s’attendait à ce que ça ne fonctionne pas. On voit bien, dans les réponses que nous fait l’IA au quotidien, qu’elle est dans une forme d’empathie un peu gratuite, de fausse bienveillance. Ça lisse, en fait. On ne s’attendait donc pas du tout à ce que les résultats soient bons, par contre on ne savait pas comment ça allait se traduire dans les données. C’est pour ça qu’on a voulu comparer plusieurs modèles et voir leur impact sur les résultats, même si ce sont les modèles de mars et qu’il faudrait sans doute refaire tourner l’étude aujourd’hui.

Et puis le premier protocole, construit par l’IA, n’était pas bon. On lui avait expliqué très précisément qu’on voulait simuler les comportements en piochant dans la base Nemotron un échantillon représentatif de celui qu’on avait interrogé nous-mêmes. La tâche semblait assez simple. De sa propre initiative, sans nous le soumettre, elle est partie sur un traitement par lots, par souci d’optimisation (elle cherche toujours à économiser les tokens qu’elle consomme). On ne lui avait absolument pas demandé, et on s’en est rendu compte un peu par hasard, en regardant les résultats. Plutôt que de jeter ce premier passage, on l’a gardé dans la comparaison pour mesurer l’impact que ça avait.

On avait les réponses de 1 000 vrais Français

À l’été 2024, on a mené pour Cultura une étude quantitative auprès d’un panel de 1 000 Français, sur leurs pratiques culturelles et leurs habitudes de consommation. On la raconte en détail dans l’étude de cas. On avait donc le profil socio-démographique de chaque répondant et ses réponses à une dizaine de questions : revenus, budget culturel, fréquence de lecture, satisfaction, achat d’occasion. En faisant répondre un LLM au même questionnaire, à partir de profils tirés pour approcher la même composition, on pouvait mesurer l’écart avec les vraies réponses, question par question.

D’autres l’ont fait avant nous sous le nom de « silicon samples » (Argyle et al., 2023, dans Political Analysis), surtout en anglais et sur des sondages d’opinion. Nous, on avait un questionnaire français qu’on avait conçu nous-mêmes, sur un sujet où la désirabilité sociale pèse beaucoup.

Trois façons de faire répondre l’IA

En mars 2026, on a généré 3 000 répondants synthétiques, 1 000 dans chacune de ces trois conditions :

  • le traitement par lots, celui que l’IA avait choisi d’elle-même : Claude Sonnet 4.6 reçoit les profils par lots de 5 avec un prompt standard, et les traite à la chaîne ;
  • l’incarnation avec Sonnet 4.6 : on lui demande d’incarner chaque profil avant de répondre, un par un, 1 000 fois, avec le même modèle mais une autre méthode ;
  • l’incarnation avec Claude Opus 4.6, selon la même méthode.

Générer les réponses une par une prend du temps et coûte plus cher que par lots. Les profils viennent de la base Nemotron, où on a tiré 1 000 profils en visant la composition du panel réel en sexe, âge et CSP. Le LLM reçoit ces profils tels quels, et c’est à lui de simuler les réponses aux questions d’attitude et de comportement. L’étude porte sur 10 variables. Le revenu mensuel net est à part, parce que le prompt le fixe en partie en donnant la tranche de CSP et d’âge, et le LLM choisit la tranche de revenu exacte. Les neuf autres sont entièrement simulées : opinion sur le pouvoir d’achat, temps de loisirs culturels, satisfaction, budget annuel, évolution du budget, fréquence de lecture, nombre de livres lus par an, fréquence des loisirs créatifs et achat d’occasion.

Les tests statistiques

Pour chaque variable et chaque condition, on a mesuré l’écart entre distributions réelles et synthétiques :

  • Sur les variables catégorielles, on a utilisé un Chi-2 d’indépendance et un V de Cramér (0 quand les distributions sont identiques, 1 quand elles n’ont rien à voir)
  • Sur les variables numériques, un Mann-Whitney U et un r rank-biserial
  • Pour comparer les conditions entre elles sur les mêmes personas, un Wilcoxon signé
  • Pour les trois conditions simultanément, un Friedman
  • Et une correction de Bonferroni sur les 30 tests (10 variables × 3 conditions), avec un seuil à 0,00167

En moyenne, les lots s’éloignent le plus du réel

Variable par variable, voici l’écart au réel de chaque condition.

Plus la valeur est basse, plus le panel synthétique est proche du réel.

Vue d'ensemble : V de Cramér par variable Écart entre les réponses synthétiques et les vraies, variable par variable (V de Cramér : plus il est bas, plus le synthétique ressemble au réel).

Pour « Livres lus par an », la valeur est un r rank-biserial (test de Mann-Whitney), pas un V de Cramér : elle ne se compare pas directement aux autres barres.

Voir les données
Vue d'ensemble : V de Cramér par variable
VariablePar lotsIncarnation SonnetIncarnation OpusMeilleure condition
Revenu mensuel netV = 0,375V = 0,415V = 0,328Incarnation Opus
Opinion sur le revenuV = 0,292V = 0,288V = 0,284Incarnation Opus
Temps loisirs culturels/semaineV = 0,391V = 0,234V = 0,257Incarnation Sonnet
Satisfaction loisirs culturelsV = 0,407V = 0,004V = 0,140Incarnation Sonnet
Budget annuel biens culturelsV = 0,363V = 0,375V = 0,297Incarnation Opus
Évolution budgetV = 0,469V = 0,460V = 0,483Incarnation Sonnet
Fréquence de lectureV = 0,336V = 0,242V = 0,311Incarnation Sonnet
Livres lus par anr = 0,088r = 0,101r = 0,026Incarnation Opus
Fréquence loisirs créatifsV = 0,526V = 0,263V = 0,398Incarnation Sonnet
Achat occasionV = 0,350V = 0,008V = 0,120Incarnation Sonnet

Sur les neuf variables simulées, le traitement par lots n’est jamais le plus proche du réel. En moyenne, l’incarnation avec Sonnet fait passer l’écart de 0,358 à 0,219, soit près de 40 % de moins.

Plus la valeur est basse, plus le panel synthétique est proche du réel.

Écart moyen au réel sur les 9 variables simulées (V de Cramér) Écart moyen au réel (V de Cramér) sur les 9 variables simulées, par condition : plus il est bas, plus les réponses synthétiques ressemblent aux vraies.

Moyenne sur les 9 variables simulées ; le revenu, fixé en partie par le prompt, est exclu.

Voir les données
Écart moyen au réel sur les 9 variables simulées (V de Cramér)
ConditionÉcart moyenÉcart médianÉcart maxVariables où elle est la plus proche
Incarnation Sonnet0,2190,2420,4606/9
Incarnation Opus0,2570,2840,4833/9
Par lots0,3580,3630,5260/9

Le budget d’une année sur l’autre

Si vous avez l’habitude des résultats de questionnaire, les écarts en points vous parleront sans doute plus que les tailles d’effet. On les montre en écart au réel, parce que la distribution d’origine du client reste confidentielle.

On demandait aux répondants si leur budget culturel avait changé par rapport à l’année précédente.

Évolution du budget : écart des synthétiques au réel (le pire cas) Écart en points entre les réponses synthétiques et les vraies. Les trois conditions surestiment « le même » d'environ 39 points et sous-estiment le « je ne sais pas » d'une douzaine de points.

Zéro = identique au réel ; une barre vers le haut sur-représente la réponse, vers le bas la sous-représente.

Voir les données
Évolution du budget : écart des synthétiques au réel (le pire cas)
RéponsePar lotsIncarnation SonnetIncarnation Opus
Moins−17−17−18
Le même+39+38+40
Plus−10−9−10
Ne sait pas−12−13−12

Les trois conditions échouent autant (V de 0,46 à 0,48, toutes significatives, p < 10⁻⁸⁹). Le LLM sous-estime les changements de budget, dans un sens comme dans l’autre : il ramène les réponses sur « le même », environ 39 points au-dessus du réel, et donne une douzaine de points de moins au « je ne sais pas ».

L’achat d’occasion

On demandait aux répondants s’ils achètent des biens culturels d’occasion.

Achat d'occasion : écart au réel (le meilleur cas) Écart en points aux vraies réponses sur l'achat d'occasion : 32 points de trop par lots, moins d'un point avec l'incarnation Sonnet.

Zéro = identique au réel ; une barre vers le haut sur-représente la réponse, vers le bas la sous-représente.

Voir les données
Achat d'occasion : écart au réel (le meilleur cas)
RéponsePar lotsIncarnation SonnetIncarnation Opus
Oui+32+1+12
Non−32−1−12

Les répondants synthétiques traités par lots déclarent acheter d’occasion 32 points de plus que les vrais. L’incarnation Sonnet ramène l’écart à 0,9 point, et on ne le distingue plus statistiquement du réel (Chi-2 = 0,11, p = 0,74, V = 0,008).

Les loisirs créatifs

Loisirs créatifs : écart au réel (le cas le plus contrasté) Écart en points aux vraies réponses selon la fréquence. Par lots, la part de ceux qui ne pratiquent jamais baisse de près de 32 points ; avec l'incarnation Sonnet, l'écart tombe sous 1 point.

Zéro = identique au réel ; une barre vers le haut sur-représente la réponse, vers le bas la sous-représente.

Voir les données
Loisirs créatifs : écart au réel (le cas le plus contrasté)
RéponsePar lotsIncarnation SonnetIncarnation Opus
Jamais−32+1−24
Rarement+18+9+18
2-3 fois/semaine+21+4+9

C’est ici que les conditions s’écartent le plus l’une de l’autre (V de 0,526 par lots, 0,263 avec l’incarnation Sonnet). Par lots, la part de ceux qui n’en font jamais perd près de 32 points. Avec l’incarnation Sonnet, l’écart n’est plus que de 0,9 point.

3 résultats sur 30 qu’on ne distingue pas statistiquement du réel

Sur les 30 tests, 27 restent significatifs après correction de Bonferroni (p < 0,00167), donc dans 27 cas sur 30 la distribution synthétique diffère statistiquement de la vraie. Les 3 exceptions :

Les 3 tests non significatifs après correction de Bonferroni
VariableConditionChi-2pV de Cramér
Satisfaction loisirsIncarnation Sonnet0,030,860,004
Livres lus/anIncarnation OpusU = 470 6770,32r = 0,026
Achat occasionIncarnation Sonnet0,110,740,008

La méthode change les réponses

Le test de Friedman compare les trois conditions en même temps, sur les mêmes profils (les 964 qui ont une réponse valide dans les trois). Sur 9 variables sur 10, elles produisent des distributions significativement différentes entre elles (p de 10⁻⁹⁶ à 10⁻¹⁵). La seule exception est l’évolution du budget (p = 0,061), où les trois échouent de la même manière.

Taille d’effet par variable et condition Vert = proche du réel, rouge = éloigné
Taille d’effet par variable et condition : Vert = proche du réel, rouge = éloigné
Variable Par lotsIncarnation SonnetIncarnation Opus
Revenu mensuel 0,375 0,415 0,328
Opinion revenu 0,292 0,288 0,284
Temps loisirs 0,391 0,234 0,257
Satisfaction loisirs 0,407 0,004 n.s. 0,140
Budget culturel 0,363 0,375 0,297
Évolution budget 0,469 0,460 0,483
Fréq. lecture 0,336 0,242 0,311
Livres lus/an 0,088 0,101 0,026 n.s.
Loisirs créatifs 0,526 0,263 0,398
Achat occasion 0,350 0,008 n.s. 0,120

« Livres lus/an » est mesurée par un r rank-biserial (Mann-Whitney U), pas un V de Cramér. Les cellules « n.s. » ne sont pas statistiquement distinguables du réel.

Tout le monde finit au milieu

Ce qui nous a le plus frappés, c’est le lissage. Les réponses synthétiques n’ont pas d’extrêmes : presque personne n’avoue que son budget baisse, personne ne reconnaît un comportement socialement peu acceptable. Quelle que soit la coloration qu’on donne aux profils, le modèle répond comme un profil moyen. On le mesure sur cinq écarts :

  • sur l’évolution du budget, on l’a vu, aucune condition ne corrige l’écart, le plus fort de l’étude ;
  • les tranches hautes (revenus au-dessus de 4 000 €, plus de 20 heures de loisirs par semaine) et basses (moins de 1 000 €, vie « très difficile ») sont systématiquement sous-représentées (V de 0,29 à 0,42) ;
  • les comportements socialement valorisés, comme l’achat d’occasion ou l’engagement culturel, sont sur-représentés (V de 0,01 à 0,35 selon la condition), et l’incarnation réduit ce biais sans l’éliminer partout ;
  • les profils synthétiques lisent et pratiquent plus que les vrais répondants, et se disent plus souvent insatisfaits de ne pas pratiquer davantage (V de 0,24 à 0,53) ;
  • les réponses synthétiques sous-estiment nettement le « je ne sais pas » sur le budget et son évolution.

C’est hyper problématique, parce qu’une étude quantitative montre aussi comment les réponses se répartissent, extrêmes compris, au-delà de la moyenne. Du coup, les réponses synthétiques ne vont pas chercher ce qui fait la vraie différence entre les gens, ces différences subtiles qui relèvent, quelque part, un peu de l’humain.

D’où vient le biais ?

Les réponses synthétiques surestiment l’engagement culturel. On a quand même voulu vérifier que ça ne venait pas de la base, et on a fait noter les 1 000 profils Nemotron par Gemini 2.5 Pro, de 0 à 10, selon la densité des pratiques culturelles réelles qu’ils décrivent, comme « joue du piano électrique depuis l’adolescence » ou « fréquentant le Musée des Beaux-Arts de Tours où il apprécie les expositions temporaires ». On a vérifié cette notation avec un deuxième évaluateur, Claude Sonnet 4.6, et les deux concordent (kappa de Cohen = 0,77, corrélation de Spearman = 0,79).

Selon l’évaluateur, 0,3 % à 5 % des profils décrivent quelqu’un qui n’a presque aucune pratique culturelle. C’est peu, mais dans notre vrai panel, la part de répondants qui ne lisent jamais et ne font jamais de loisirs créatifs est du même ordre de grandeur. Les deux mesures ne sont pas identiques. D’un côté, un modèle note un profil écrit ; de l’autre, des gens déclarent ce qu’ils font. Mais la base ne paraît pas beaucoup plus « culturelle » que les vrais répondants.

Engagement culturel des profils Nemotron Répartition des 1 000 profils Nemotron selon la densité de pratiques culturelles qu'ils décrivent (note de Gemini 2.5 Pro, de 0 à 10).
Voir les données
Engagement culturel des profils Nemotron
Niveau d'engagementScoreProfils Nemotron
Faible0-25,0 %
Modéré3-424,1 %
Significatif5-637,2 %
Intense7+33,7 %

Le modèle, lui, suit ce que dit le profil, avec une corrélation modérée à forte entre le score culturel d’un profil et ses réponses sur toutes les variables.

Le modèle suit ce que dit le profil (corrélations de Spearman) Corrélation de Spearman entre le score culturel d'un profil et les réponses du modèle, par variable.
Voir les données
Le modèle suit ce que dit le profil (corrélations de Spearman)
VariableIncarnation Sonnet (rho)Incarnation Opus (rho)
Rapport à la culture0,590,72
Fréquence de lecture0,400,44
Loisirs créatifs0,460,37
Livres lus/an0,490,50
Achat d'occasion0,400,43

Parmi les 50 profils les moins culturels, aucun ne se dit passionné par la culture, et 37 sur 49 répondent qu’ils ne font jamais de loisirs créatifs avec Sonnet (24 sur 50 avec Opus). Quand un profil décrit quelqu’un qui passe du temps au musée « à explorer les expositions d’art contemporain et à assister aux ateliers de gravure », le modèle répond, logiquement, que la culture compte pour lui. Le petit nombre de profils peu culturels n’explique donc pas l’écart. Sur les loisirs créatifs, l’incarnation Opus reste 24 points sous le vrai panel pour la part de ceux qui n’en font jamais, bien plus loin que Sonnet.

Pour nous, le problème n’a jamais vraiment été du côté de la base, qui est ce qu’elle est. Même si elle n’avait pas été générée par une IA, on sait constituer des bases de dizaines, voire de centaines de milliers de personnes. Le moindre CRM d’un de nos clients contient une bonne partie des informations de Nemotron, sur un périmètre plus étroit, et il n’est pas d’une qualité folle non plus. L’existence même de Nemotron laissait deviner chez nos clients l’envie de confier la démarche de bout en bout à une IA, et si ce risque existe, il faut le tester. Par contre, ce qui nous intéressait bien plus, c’était de voir comment, malgré tout, le modèle arrive à incarner des gens.

Et là-dessus, on est assez convaincus que même avec une meilleure base, l’effet resterait, à cause d’une forme de désirabilité sociale chez des agents IA qui cherchent à plaire. On pourra nous répondre qu’un prompt adapté peut la contrebalancer, mais en fait, même un prompt adapté exposerait au risque de tomber dans le biais inverse. Aujourd’hui, reproduire la courbe normale de la diversité des comportements ne nous paraît pas possible avec la technologie actuelle et la manière dont elle a été pensée. Notre sentiment, c’est que le problème vient de la technologie elle-même, pas de la donnée. Elle ne rend pas, quelque part, l’humanité des gens. C’est sans doute un peu rassurant, et c’est peut-être pour ça qu’on a envie de le penser.

À quoi ça peut servir ?

On entend dire que ça ne coûte pas grand-chose de se servir de ces panels synthétiques pour pré-tester un questionnaire ou explorer des segmentations avant d’aller sur le terrain. On n’en est pas certains : une poignée d’agents à qui on demande de simuler des comportements un peu hétérogènes ferait sans doute aussi bien, et on ne voit pas de valeur ajoutée énorme à exploiter une base comme Nemotron. Aujourd’hui, on s’interroge vraiment sur l’intérêt de ce type d’approche. Depuis six mois, NVIDIA et la start-up avec qui ils ont travaillé ont fait un petit effet d’annonce, qui n’a d’ailleurs pas eu un énorme écho.

Les limites de cette étude

En reprenant les fichiers de l’étude en septembre 2026, on a trouvé deux défauts, qu’on a pu corriger après coup :

  • les 1 000 profils ne sont pas ceux des vrais répondants mais des profils Nemotron, et leur tirage a combiné sexe, âge et CSP comme si ces critères étaient indépendants. Le panel synthétique est donc plus jeune que le vrai, avec 75 personnes de 70 ans et plus en moins et 44 retraités de 50 à 59 ans en trop. En pondérant les réponses synthétiques pour retrouver la composition réelle, les écarts ne bougent presque pas (écart moyen de 0,219 avant comme après pour l’incarnation Sonnet, de 0,358 à 0,347 pour les lots), et ce décalage n’explique donc pas ce qu’on mesure ;
  • 162 fichiers de réponses de l’incarnation Sonnet sur 1 000 étaient mal rangés, si bien que les comparaisons entre conditions mettaient parfois face à face deux profils différents. On a refait les calculs en rangeant chaque réponse avec son profil, et les chiffres de cet article sont ceux de ce nouveau calcul, sans que les conclusions changent.

On va refaire l’étude avec les modèles actuels, en comparant Sonnet et Opus sur 100 profils pour commencer.

Vous souhaitez discuter de votre projet ?

Tout le monde parle expérience utilisateur, design de service, ergonomie… C’est pas très clair, mais vous aimeriez bien découvrir tout ça ou progresser.

Contactez-nous