L’IA n’en finit pas de soulever des débats — sur ce qu’elle permet de faire, les transformations qu’elle entraîne, mais aussi les limites à lui donner. Et le monde des études et de la recherche marketing n’y échappe évidemment pas, tant les usages se multiplient et viennent parfois questionner jusqu’aux fondements mêmes de nos métiers.
Sur MRNews, nous suivons naturellement ces transformations au fil de nombreux articles et dossiers consacrés aux usages de l’IA dans les études. Mais nous avons également à cœur de faire vivre le débat plus large qu’elle soulève pour nos métiers, avec notamment les tribunes de Luc Balleroy (OpinionWay), Mathilde Guinaudeau (Ipsos bva) et Laurent Florès (FlashInsight), notre nouveau chroniqueur invité avec sa rubrique « IA-conoclaste ». Ou encore avec des interviews, comme celle d’Anne-Sophie Damelincourt, présidente d’ESOMAR.
Nous poursuivons aujourd’hui dans cette voie avec Florian Jésupret Ferté, directeur d’études chez ThinkOut. Il s’intéresse à l’un des sujets qui agitent particulièrement la profession : les répondants synthétiques. Avec, derrière les questions de fiabilité ou de performance, un enjeu peut-être plus fondamental encore : celui de la nature même de la connaissance que les études ont vocation à produire.
LA TRIBUNE DE FLORIAN JÉSUPRET FERTÉ, DIRECTEUR D’ÉTUDES CHEZ THINKOUT
La promesse des données synthétiques est séduisante. Recruter coûte cher, les terrains prennent du temps, les panels ne sont pas exempts de défauts — représentativité, sincérité, accessibilité, etc. Face à cela, l’IA offre un rêve pour nous, les gens d’études : des consommateurs disponibles directement, à coût marginal presque nul, capables de répondre en quelques secondes à une infinité de questions.
Et soyons francs : nous utilisons nous-mêmes l’IA tous les jours. Pour éplucher un appel d’offres, retravailler un guide, confronter des hypothèses, retranscrire, synthétiser des centaines de réponses, explorer des masses documentaires ou challenger une analyse. Elle ouvre aussi des possibilités passionnantes dans le recueil lui-même comme en matière de livrables. L’IA représente déjà un formidable outil pour notre métier et elle le sera encore davantage demain.
Mais les répondants synthétiques nous font peut-être franchir une étape d’une autre nature.
La carte n’est pas le territoire
Le penseur et épistémologue Alfred Korzybski nous a légué une formule devenue célèbre : « la carte n’est pas le territoire ». Je pense que tout notre métier pourrait presque tenir dans cette évidence. Une segmentation est une carte, un persona est une carte, une typologie est une carte, un modèle statistique est une carte. Et même le meilleur rapport d’étude demeure une représentation organisée, nécessairement imparfaite, d’une réalité qui le dépasse.
Le problème commence quand on oublie qu’on regarde une carte. Or, les nouveaux dispositifs synthétiques rendent précisément cette distinction plus difficile.
Les données synthétiques sont d’autant plus troublantes qu’elles ne ressemblent plus aux persona un peu caricaturaux que nous dessinions autrefois sur un PowerPoint. Certaines sont nourries de données quantitatives et qualitatives réelles. D’autres s’appuient sur des conversations humaines recueillies en ligne puis les « incarnent » dans des bots avec lesquels il devient possible de dialoguer comme lors d’un entretien qualitatif. D’autres encore créent des jumeaux numériques d’individus déjà interrogés afin de leur poser de nouvelles questions sans retourner vers eux.
Ces approches sont aujourd’hui revendiquées, avec des niveaux de prudence variables, par plusieurs acteurs du marché des études. Les garde-fous avancés sont loin d’être absurdes : données humaines à l’origine, validation scientifique, experts humains dans la boucle.
Mais maintenir de l’humain dans le processus n’est pas tout à fait la même chose que maintenir l’humain comme objet d’observation. À partir du moment où je pose une question qui n’a jamais été posée à une personne réelle et où un modèle génère ce qu’il estime être sa réponse probable, je ne mesure plus ce qu’elle pense : je prédis ce qu’elle pourrait penser. La différence est immense.
À partir du moment où je pose une question qui n’a jamais été posée à une personne réelle et où un modèle génère ce qu’il estime être sa réponse probable, je ne mesure plus ce qu’elle pense : je prédis ce qu’elle pourrait penser. La différence est immense.
Le réalisme n’est pas la réalité
Cette différence serait facile à garder en tête si les réponses produites par les modèles nous semblaient artificielles. Mais c’est précisément là que les choses se compliquent.
Lire aussi > Données synthétiques : baguette magique ou mirage ? – Tribune de Mathilde Guinaudeau, Ipsos bva
C’est peut-être le principal tour de magie des grands modèles de langage : ils sont devenus extraordinairement doués pour produire du plausible. Ils ne savent pas seulement donner de bonnes réponses, mais aussi produire des réponses qui ressemblent à celles que nous attendons, saupoudrées des signes discursifs que nous associons à l’authenticité. Et peut-être que de vraies personnes auraient effectivement dit tout cela. C’est précisément le problème : le réalisme d’un verbatim ne prouve pas sa réalité.
C’est peut-être le principal tour de magie des grands modèles de langage : ils sont devenus extraordinairement doués pour produire du plausible. Ils ne savent pas seulement donner de bonnes réponses, mais aussi produire des réponses qui ressemblent à celles que nous attendons, saupoudrées des signes discursifs que nous associons à l’authenticité
Un insight n’est pas simplement une phrase intelligente et vraisemblable que nous aurions aimé entendre sortir de la bouche d’un consommateur. Un insight, c’est ce qui nous apprend quelque chose sur ce qui existe effectivement en dehors de nos modèles.
Les répondants synthétiques, même lorsqu’ils sont fondés sur des données humaines, changent donc la nature de l’opération : ils ne recueillent plus des opinions, mais en produisent une représentation vraisemblable.
La critique la plus attendue à l’encontre des données synthétiques consiste aujourd’hui à montrer leurs erreurs : biais, variance insuffisante, instabilité des résultats, hallucinations, etc. Cependant, cette critique a déjà une date de péremption. Je suis certain que les modèles vont progresser, que les données dont ils disposent vont s’enrichir et que leurs représentations seront sans doute de plus en plus justes.
Et c’est justement là que la question devient intéressante.
Car notre métier ne consiste pas seulement à confirmer, à travers nos terrains, ce que nous savons déjà ou ce que nous nous attendons à trouver. Il consiste aussi à repérer ce qui dévie, ce qui change, ce qui dérange, ce qui nous surprend. C’est précisément là que commence vraiment notre travail.
On attribue à Lacan cette formule : « le réel, c’est quand on se cogne ». Le réel résiste et il ne répond pas toujours comme prévu. Il ne rentre pas toujours dans nos catégories. Et prend parfois un malin plaisir à détruire l’hypothèse à laquelle nous étions arrivés. C’est aussi la fonction du terrain.
Le vrai risque de l’IA dans les études n’est donc peut-être pas qu’elle se trompe. C’est qu’elle devienne assez convaincante pour que nous arrêtions de nous confronter au réel.
Notre métier ne consiste pas seulement à confirmer, à travers nos terrains, ce que nous savons déjà ou ce que nous nous attendons à trouver. Il consiste aussi à repérer ce qui dévie, ce qui change, ce qui dérange, ce qui nous surprend (…). Le vrai risque de l’IA dans les études n’est donc peut-être pas qu’elle se trompe. C’est qu’elle devienne assez convaincante pour que nous arrêtions de nous confronter au réel.
Bienvenue dans le « dead research » ?
Il existe depuis quelques années une théorie un peu étrange, celle du dead internet. Dans sa version la plus radicale, elle imagine un web progressivement vidé de ses humains, où des bots produisent des contenus auxquels répondent d’autres bots, générant à leur tour des contenus qui alimentent les systèmes suivants.
Notre industrie pourrait être tentée par une version plus modeste du même phénomène.
Voilà ce que ça donnerait : des données produites hier par des humains alimentent des modèles. Ces modèles produisent des représentations synthétiques de consommateurs. Nous interrogeons ces consommateurs sur de nouveaux sujets. D’autres outils d’IA analysent et synthétisent leurs réponses. Des décideurs prennent des décisions sur cette base. Et nous recommençons. À mesure que ces médiations se multiplient, le réel s’éloigne.
Nous pourrions en arriver à cette situation absurde : des machines interrogent d’autres machines, puis les analysent afin d’expliquer à des humains ce que pensent d’autres humains.
Le danger n’est même pas nécessairement que les conclusions deviennent fausses. Le risque est beaucoup plus insidieux : produire des conclusions bien articulées, statistiquement vraisemblables, culturellement cohérentes mais progressivement hors sol.
Nous pourrions en arriver à cette situation absurde : des machines interrogent d’autres machines, puis les analysent afin d’expliquer à des humains ce que pensent d’autres humains. Le danger n’est même pas nécessairement que les conclusions deviennent fausses. Le risque est beaucoup plus insidieux : produire des conclusions bien articulées, statistiquement vraisemblables, culturellement cohérentes mais progressivement hors sol.
Or, si notre métier conserve, comme je le crois, une valeur dans un monde saturé de données et de modèles prédictifs, elle se trouve précisément ailleurs : dans notre capacité à organiser la rencontre avec ce que nous n’avions pas prévu.
Garder le réel dans la boucle
La conclusion la plus confortable serait évidemment de défendre le bon vieux terrain humain contre les méchantes machines.
Nos terrains humains ont leurs propres défauts. Les panels connaissent des problèmes de qualité. Les échantillons sont imparfaits. Pire, comme dans la vraie vie, les gens ne pensent pas toujours ce qu’ils ressentent, ne disent pas forcément ce qu’ils pensent et ne font absolument pas ce qu’ils disent. Le fait qu’une donnée provienne biologiquement d’un Homo sapiens ne lui confère aucun certificat automatique de vérité.
Une simulation peut être formidable pour générer une hypothèse, mais une hypothèse doit pouvoir perdre. Les persona et les typologies sont remarquables pour explorer un scénario, mais ni les uns ni les autres n’existent dans la réalité.
Je pense que l’IA nous donne l’occasion extraordinaire de nous débarrasser d’une grande partie du travail fastidieux qui entourait jusque-là l’écoute des gens. Elle peut rendre nos études plus rapides, plus accessibles, plus efficaces et plus ambitieuses. Elle peut nous permettre d’analyser davantage, d’approfondir davantage, de croiser davantage, de tester davantage. Profitons-en.
Mais méfions-nous le jour où cette automatisation commencera surtout à nous permettre de ne plus avoir à écouter les gens du tout.
L’IA nous donne l’occasion extraordinaire de nous débarrasser d’une grande partie du travail fastidieux qui entourait jusque-là l’écoute des gens (…). Profitons-en. Mais méfions-nous le jour où cette automatisation commencera surtout à nous permettre de ne plus avoir à écouter les gens du tout.
Nous pourrons dès demain produire des représentations toujours plus fines et plus crédibles des publics que nous cherchons à comprendre. Mais pendant ce temps, les gens continueront à vivre, changer, se contredire, désobéir à nos catégories et inventer des comportements que nos modèles n’avaient pas prévus.
C’est probablement une bonne raison pour continuer, de temps en temps, à aller leur parler.
POUR ACTION
• Echanger avec l’interviewé(e) : @ Florian Jésupret Ferté
• Retrouver l’ensemble des interviews et tribunes sur le thème IA et market research



