Interroger un modèle d’intelligence artificielle à la place de milliers de personnes promet de raccourcir le travail des sondeurs. Mais que mesure-t-on vraiment : l’opinion du public ou la manière dont un logiciel imagine ce public ? Une étude publiée le 30 septembre 2026 par Pew Research Center donne une réponse préoccupante. Ses répondants virtuels s’écartent nettement des enquêtes humaines, tout en effaçant une partie de leur diversité.
Le résultat invite à regarder au-delà des pourcentages bien présentés. Un panel artificiel peut produire des données cohérentes en apparence et raconter une société qui ressemble mal à celle que l’on cherche à comprendre. Le rapport de Pew documente précisément cette difficulté.
Des profils détaillés, mais personne au bout du questionnaire
Le procédé porte un nom : silicon sampling. Il consiste à demander à un grand modèle de langage de répondre comme le ferait une personne présentant certaines caractéristiques. Agrégées, ces réponses deviennent un sondage synthétique.
Pew a construit des « jumeaux numériques » de participants réels à son American Trends Panel. Les profils comprenaient des informations démographiques et des réponses antérieures sur leurs valeurs politiques. Le modèle recevait les questions successivement, avec le souvenir de ses réponses précédentes. Le protocole cherchait donc à reproduire un parcours d’enquête, avec davantage de précision qu’une simple consigne du type « imagine un électeur américain ».
Trois vagues d’enquêtes du premier semestre 2026 ont servi de référence. Les résultats principaux proviennent de Claude Opus 4.6, avec un niveau de raisonnement faible, des profils enrichis et une étape d’interprétation de ces profils. Ces choix ont été testés ; ils ne constituent pas une comparaison exhaustive de toutes les méthodes possibles. La méthodologie détaillée permet de comprendre ce que l’expérience mesure.
Un écart moyen de 12,4 points qui ne résume pas tous les ratés
Le tableau récapitulatif de Pew affiche une erreur absolue moyenne de 12,4 points de pourcentage, en moyenne sur les trois vagues. Pour chaque question, les chercheurs comparent les proportions obtenues pour les différentes réponses, prennent les écarts en valeur absolue, puis les moyennent. Ce chiffre ne signifie donc pas que 12,4 % des personnes simulées auraient « mal répondu ».
Cette distinction compte : l’indicateur décrit une déformation des distributions d’opinion. Les écarts concernent aussi les sous-groupes, avec une moyenne de 16,1 points pour les républicains et leurs sympathisants, et de 15,1 points pour les adultes noirs américains. Les résultats détaillés montrent une difficulté qui dépasse quelques questions isolées.
Pour un lecteur, le risque serait de traiter un pourcentage synthétique comme une mesure de terrain. Ajouter des milliers de réponses produites par la même méthode ne démontre pas que son biais disparaît : un tableau plus volumineux peut conserver la même mauvaise représentation.
Quand une moyenne plausible masque des opinions absentes
Les écarts ne prennent pas toujours la forme d’un résultat complètement inversé. Sur la légalisation de l’avortement, le panel Opus retrouve approximativement la répartition générale entre soutien et opposition. Pourtant, il sous-estime certaines positions tranchées et ne reproduit pas toute la distribution humaine.
L’expérience relève aussi des réponses excessivement concentrées sur certaines catégories. Sur la difficulté à s’endormir, 77 % des profils synthétiques choisissent « certains jours », contre 36 % des répondants humains. Une apparente opinion dominante peut ainsi remplacer des expériences beaucoup plus variées. Le chapitre consacré à cette diversité montre pourquoi il faut examiner chaque modalité, au-delà d’un total rassurant.
Le répondant virtuel sait trop de choses et doute trop peu
Un autre défaut est particulièrement révélateur. Sur les questions d’opinion proposant explicitement une réponse d’incertitude, les humains la choisissent dans 16 % des cas ; les répondants synthétiques, dans 4 % des cas.
Les questions de connaissance produisent un déséquilibre comparable : 98 % des profils artificiels identifient correctement un droit garanti par le premier amendement de la Constitution américaine, contre 52 % des participants réels. Pew documente ces écarts de certitude et de connaissance.
Pour un assistant, fournir la bonne information est généralement utile. Pour un logiciel censé imiter une population, connaître la réponse à sa place peut fausser la mesure. Une campagne d’information conçue sur cette base pourrait supposer, à tort, qu’un sujet est déjà compris. L’ignorance, l’hésitation et le désintérêt font aussi partie de ce qu’un sondage doit observer.
Changer de modèle peut changer le portrait du pays
Pew a également comparé GPT-5.1 et Claude Opus 4.6 sur une même enquête. Les deux systèmes produisent parfois des récits très différents. Sur la satisfaction envers la direction prise par les États-Unis, Opus estime l’insatisfaction à 70 %, près des 69 % mesurés auprès des humains. GPT la porte à 100 %. Sur une autre question, relative à l’existence de solutions claires aux grands problèmes du pays, GPT est plus proche des réponses humaines qu’Opus.
Il serait donc hasardeux de désigner un modèle universellement fiable à partir d’un bon résultat. Cette comparaison montre surtout que le choix technique peut modifier le récit tiré du sondage.
Une alerte américaine qui rejoint une question européenne
Une prépublication de Chuyao Wang, déposée le 14 septembre sur arXiv, examine également cette approche avec l’European Social Survey : 30 pays, 42 questions et deux modèles à poids ouverts. Elle observe une récupération inégale des différences entre pays, mais des résultats individuels négligeables dans les configurations étudiées. Il s’agit d’un travail préliminaire, distinct de l’étude Pew, dont les résultats ne peuvent pas être additionnés aux siens. La prépublication souligne néanmoins la même distinction utile entre une ressemblance agrégée et une représentation fidèle des individus.
Avant de croire un sondage, demander qui a répondu
Ces expériences ne démontrent pas que toute donnée synthétique est inutile. Elles évaluent des protocoles, des modèles et des questionnaires précis. Elles ne valident pas non plus les usages futurs simplement parce que les modèles progresseront.
Pour une rédaction, une entreprise ou un décideur, trois vérifications deviennent essentielles : les personnes ont-elles réellement été interrogées ? Les estimations artificielles ont-elles été confrontées à des données humaines récentes ? Les erreurs sont-elles publiées par question et par sous-groupe ?
L’intérêt d’une enquête reste sa capacité à découvrir ce que l’on ne savait pas. Un outil qui reproduit des attentes plausibles peut aider à formuler des hypothèses ; l’utiliser pour les confirmer sans rencontrer le public risque de fermer cette fenêtre. La vitesse de production d’un sondage ne remplace pas la qualité de l’écoute.
Références
- Pew Research Center — présentation du rapport, 30 septembre 2026.
- Pew — protocole expérimental et choix des modèles.
- Pew — écarts entre sondages humains et synthétiques.
- Pew — diversité des opinions, certitude et connaissance, effet du choix de modèle.
- Chuyao Wang — étude sur l’European Social Survey, prépublication arXiv du 14 septembre 2026.

