GEO · 6 min de lecture

« +40 % prouvés par Princeton » : ce que l'étude mesure vraiment

Un chiffre revient dans presque toutes les présentations sur la visibilité dans les réponses des IA : « +40 % de visibilité, prouvés par une étude de Princeton ». Il est commode, frappant, et il vient bien d'un travail sérieux.

Illustration de l'article : les 40 % de l'étude GEO, ce qu'ils mesurent vraiment

Nous avons rouvert l'étude. Trois choses ne tiennent pas : le chiffre n'est pas une moyenne, il ne mesure pas ce qu'on lui fait dire, et l'étude n'est pas de Princeton.

D'où vient le chiffre

L'étude s'appelle GEO: Generative Engine Optimization. Parue en novembre 2023, présentée à la conférence KDD en 2024, c'est elle qui a mis le sigle GEO en circulation : avant elle, le mot n'existait pas dans ce sens.

Son résumé contient la phrase que tout le monde reprend : GEO can boost visibility by up to 40% in generative engine responses. « Up to », c'est-à-dire au mieux. Le chiffre est le haut de la fourchette : la meilleure des neuf variantes testées, sur le sous-ensemble de requêtes où elle marche le mieux. Repris en français, le « jusqu'à » disparaît presque toujours : un maximum devient un résultat moyen.

Nous l'avions perdu nous aussi. La version française que nous publions du manuel de Warren Hance a d'abord traité les 40 % comme une valeur : son texte porte le « up to » en toutes lettres, notre traduction l'avait laissé tomber. Nous ne l'avons pas vu en vérifiant les vingt sources une par une, mais en écrivant cet article, parce qu'expliquer un chiffre oblige à dire d'où il sort. Corrigé avant publication.

Une traduction ne perd pas des phrases. Elle perd les mots de prudence, un « jusqu'à », un « peut », un « environ » : ceux-là mêmes que le marché efface ensuite.

Ce que l'expérience fait vraiment

Dans l'expérience, cinq sources sont placées d'avance dans le contexte du modèle, tirées une fois pour toutes de Google avant l'essai. Le modèle ne va pas chercher sur le web : il rédige une réponse à partir de ces cinq textes.

Les chercheurs modifient ensuite le contenu de l'un de ces textes, puis mesurent la part du texte de la réponse attribuable à cette source, pondérée par sa position dans la réponse.

Autrement dit : à cinq sources déjà retenues, laquelle occupe le plus de place dans la réponse rédigée.

Ce que le chiffre ne mesure pas

Ce n'est pas un classement. Les cinq sources sont sélectionnées avant l'essai. L'étude ne dit rien sur la façon d'entrer dans cette sélection, précisément la question que se pose une entreprise.

Ce n'est pas une récupération sur le web vivant. Aucune requête n'est envoyée pendant l'essai. Or c'est là que se joue la visibilité réelle, et là que les moteurs diffèrent le plus.

Ce n'est ni du trafic, ni du chiffre d'affaires. L'étude mesure des mots dans une réponse, pas des visites ni des ventes. Le raccourci « +40 % de visibilité donc +40 % de quelque chose qui rapporte » n'a aucun appui dans le texte. Nous avons écrit ailleurs ce qu'on peut faire d'un chiffre choc quand on ne peut pas le vérifier.

L'étude n'est pas de Princeton

Le premier auteur, Pranjal Aggarwal, est à l'Indian Institute of Technology Delhi. Deux auteurs, Tanmay Rajpurohit et Ashwin Kalyan, sont indépendants et signent depuis Seattle. Trois sur six sont à Princeton : Vishvak Murahari, Karthik Narasimhan et Ameet Deshpande.

L'appellation « étude de Princeton » n'est donc juste qu'à moitié : elle attribue à une seule université un travail que six personnes ont signé depuis trois endroits différents, et elle efface l'établissement du premier auteur.

Pourquoi cela n'est pas de la pédanterie

On peut hausser les épaules : le chiffre est réel, l'étude existe, le raccourci est pratique. Trois raisons de ne pas s'en contenter.

Le nom sert d'argument à la place de la lecture. « Princeton » est un label de sérieux qui dispense de regarder le protocole, et c'est ce qui s'est passé : le dispositif à cinq sources préchargées est décrit noir sur blanc, et il ne figure dans presque aucune reprise francophone.

Une affirmation mal attribuée se propage sans possibilité de retour. Si vous cherchez l'étude par son nom courant, vous trouvez des commentaires ; par son titre réel, le texte. Le premier chemin ne mène jamais au second.

Et c'est un test de ce que valent les autres chiffres du même exposé. Une source dont le nom est faux a rarement été ouverte. Quand la vérification prend dix minutes et que personne ne l'a faite, c'est une information sur la chaîne de reprise, pas sur l'étude.

Ce que l'étude montre, et qui reste utile

Le travail reste solide, et il donne des résultats qu'on peut utiliser.

Ce qui augmente la part de texte reprise : des citations, des chiffres, des affirmations attribuées à quelqu'un, et une écriture fluide.

Ce qui n'aide pas : le bourrage de mots-clés. L'étude le mesure et le dit.

La lecture prudente n'est donc pas « mettez des statistiques partout », mais : une information concrète et attribuable se réutilise plus facilement qu'une prose vague. C'est assez banal, et beaucoup moins vendeur que « +40 % ».

Une mise en garde vient d'ailleurs. Une revue de quarante-cinq travaux, parue en juillet 2026, mesure qu'une page réécrite dans le seul but d'être citée devient plus difficile à récupérer : environ 9 % de présence en moins dans les vingt premiers résultats. On peut se rendre moins visible en cherchant à être mieux cité.

Ce qu'il faut retenir

Le chiffre existe. Il vaut « jusqu'à 40 % », sur un dispositif où les sources sont données d'avance, et il mesure une part de texte, pas un classement ni des visites. L'étude qui le produit est signée par six personnes dont trois seulement à Princeton.

Rien de tout cela ne demandait autre chose que d'ouvrir le fichier.

Nous avons fait le même exercice sur dix-neuf autres sources, dans notre document de référence sur ce que la recherche IA a établi et ce qu'elle n'a pas établi. Six affirmations ne tenaient pas tout à fait. Celle-ci était la plus reprise.

Réserves

Lire les trois réserves · relevé du 15 septembre 2026

Notre observation sur les reprises francophones est datée et limitée. Au 15 septembre 2026, sur la requête « étude princeton geo », les premiers résultats francophones reprennent l'appellation. Nous n'avons pas fait le tour du web francophone, et d'autres pages corrigent peut-être le tir sans que nous les ayons lues.

Nous ne rejouons pas l'expérience. Nous avons lu l'étude, relevé son dispositif et ses affiliations dans le texte intégral. Nous n'avons pas reproduit ses mesures, et nous ne prétendons pas dire si ses résultats tiennent.

Le sigle GEO vient de cette étude, et nous l'employons. Corriger son attribution n'est pas la disqualifier.

Sources

  • GEO: Generative Engine Optimization, Pranjal Aggarwal, Vishvak Murahari, Tanmay Rajpurohit, Ashwin Kalyan, Karthik Narasimhan, Ameet Deshpande, arXiv, novembre 2023, présenté à KDD 2024. Affiliations relevées en première page du texte intégral.
  • Optimizing Visibility in Generative Engines: A Critical Survey, arXiv, 15 juillet 2026, pour la mesure de la perte de récupération.

Cette page vous a servi ? Partagez-la sur LinkedIn. Pour retrouver nos publications dans vos résultats Google, ajoutez MarkenTIQ à vos sources préférées.

Julien Fauvel, pour MarkenTIQ · 15 septembre 2026

Échanger · la newsletter

Recevez les prochains articles et les annonces.

Laissez votre email : vous recevez les nouveaux articles et les annonces des prochains packs et méthodes, rien d'autre.

En vous inscrivant, vous recevez la newsletter MarkenTIQ : articles, packs de méthode, retours de terrain. Désinscription en un clic. Données traitées via Brevo.