Semawriter

SEO IA : 48,5 % des pages citées sont hors du top 20 Google

Étude française sur 1 042 requêtes : 48,5 % des pages citées par Perplexity sont hors du top 20 Google. Écart sectoriel et relevé Bing corrigé.

48,5 % des pages que Perplexity reprend dans ses réponses sont absentes du top 20 Google de la requête posée. Le chiffre vient d'une mesure directe sur un corpus français, pas d'une extrapolation depuis un marché anglophone.

Tous les conseils qui circulent en français sur le référencement naturel à l'ère de l'intelligence artificielle viennent du même endroit : les études américaines, traduites ou paraphrasées. Le papier fondateur de Princeton, présenté à KDD 2024, puis des recommandations qu'on recopie sans vérifier si elles tiennent en France. Bing pour ChatGPT, Reddit comme source reine, llms.txt comme nouveau standard.

Nous avons donc mesuré, plutôt que recopié. Entre juin et juillet 2026, le module de mesure Semawriter a collecté 1 139 snapshots Perplexity sur 1 042 requêtes informationnelles françaises, réparties sur 29 secteurs. 8 413 citations de pages uniques en sont sorties, croisées avec les positions Google sur les mêmes requêtes. Fin juin 2026, 182 de ces requêtes ont été posées simultanément à Perplexity, ChatGPT et Google Gemini.

Une précision avant les résultats. Cette étude porte d'abord sur Perplexity, le moteur le plus search-native au moment de la collecte. Et une de nos estimations publiées s'est révélée fausse : nous la corrigeons plus bas, en la nommant.

SEO IA

SEO IA : deux questions, pas une

L'expression seo ia recouvre deux demandes distinctes, et les confondre fait perdre du temps. La première : comment un site reste visible quand une réponse générée s'intercale avant les résultats de recherche. La seconde : comment l'intelligence artificielle sert le travail de référencement naturel au quotidien, de la recherche de mots-clés à la création de contenu.

Visibilité IAêtre citéetOutillage SEOproduire plus vite
Deux questions distinctes : rester visible dans une réponse générée, et se servir de l’IA pour faire du SEO.

Cette page traite les deux, en commençant par celle sur laquelle nous avons des données propriétaires. La seconde relève de la pratique outillée, et nous l'abordons sans chiffre que nous n'aurions pas mesuré.

Un point de vocabulaire, parce que le sigle circule mal. GEO signifie Generative Engine Optimization, parfois écrit GÉO en français : l'optimisation pour ces moteurs-là, pas pour la page de résultats Google. Search Engine Optimization, le SEO, désigne le référencement des moteurs de recherche classiques, celui qu'on pratique depuis vingt ans. Answer Engine Optimization, ou AEO, désigne une variante centrée sur les moteurs de questions-réponses.

Comment fonctionne

Comment fonctionne la recherche par IA générative

Ces moteurs ne renvoient pas une liste de liens. Ils produisent une réponse à partir de plusieurs sources, puis citent - ou non - certaines pages du web. ChatGPT, Gemini, Claude et Mistral reposent chacun sur leur propre mécanisme de récupération d'information, pas sur un index commun. Un modèle de langage extrait les passages qu'il juge pertinents, puis décide ce qui mérite d'être repris devant l'internaute. Comprendre cette mécanique est le préalable de toute optimisation, sur un site web marchand comme sur un site internet institutionnel.

Méthodologie

Méthodologie : ce qu'on a vraiment mesuré

Le corpus s'appuie sur 1 042 requêtes informationnelles réparties sur 29 secteurs de l'économie française : e-commerce, santé, finance, tourisme, immobilier, énergie, entre autres. Une requête n'y entre que si elle admet une réponse documentaire, pas transactionnelle.

On a collecté 1 139 snapshots, sans une seule erreur de collecte. Ça donne 24 150 lignes d'analyse, croisant ce que Perplexity reprend avec les résultats de recherche Google sur les mêmes requêtes. Les 8 413 pages citées ont été vérifiées une par une avant d'entrer dans le traitement.

Le détail qui change tout : 14 062 lignes de groupe de contrôle. Des pages bien classées sur Google, jamais reprises par Perplexity. On ne regarde pas seulement ce qui est cité, on regarde aussi ce qui aurait pu l'être et ne l'est pas. Les questions du type People Also Ask ont servi à recouper les intentions réelles.

Requêtes informationnelles1 042
Secteurs couverts29
Snapshots Perplexity collectés1 139
Lignes d'analyse24 150
Pages citées vérifiées8 413
Lignes de groupe de contrôle14 062

Le recouvrement entre deux ensembles de sources est mesuré par l'indice de Jaccard - une mesure de l'intersection entre deux ensembles, comprise entre 0, aucune source commune, et 1, sources identiques. Nous mesurons un recouvrement de pages, pas de domaines.

gradient

Le gradient : la corrélation la plus nette qu'on ait observée

Premier résultat, et il est sans appel. La corrélation de Spearman entre le rang d'un site dans la recherche Google et sa probabilité d'être repris par Perplexity atteint ρ = −0,997 (p < 0,0001). Quasi parfaite.

Rang Google 156,3 %
Rang Google 350,4 %
Rang Google 542,8 %
Rang Google 1026,6 %
Rang Google 159,8 %
Rang Google 205,2 %

La pente est linéaire. Aucune zone de rupture, aucun palier. Une page en première position a dix fois plus de chances d'être citée qu'une page en vingtième.

Pour qui arbitre son budget, le classement reste donc un socle de la visibilité dans les moteurs IA. Une corrélation forte, pas un mécanisme démontré.

Seulement, ce lien n'est pas absolu. Et c'est là que ça devient intéressant.

0%20%40%60%Probabilité de reprise135101520
Corrélation de Spearman ρ = −0,997 entre rang Google et probabilité de reprise par Perplexity.

décorrélation

La décorrélation : le rang ne fait pas tout

48,5 % des pages citées sont absentes du top 20 Google. Presque une sur deux échappe totalement au classement traditionnel. 39,2 % se trouvent dans le top 10, 12,2 % dans le top 11-20.

Pages hors top 20 Google48,5 %
Pages dans le top 1039,2 %
Pages dans le top 11-2012,2 %

Autrement dit, le SEO classique couvre 51,4 % des citations Perplexity sur notre corpus. La moitié du tableau. L'autre moitié se joue sur un index distinct de celui de Google, alimenté et rafraîchi selon ses propres règles.

La conséquence est symétrique et rarement dite. Être numéro 1 dans la recherche Google n'ouvre aucun droit à la citation, et un site abondamment repris dans les réponses générées ne remonte pas pour autant dans le classement. Deux surfaces, deux tris - une même stratégie éditoriale.

L'écart sectoriel

L'écart sectoriel : une calibration, pas une recette

C'est ici que tout se décide. Le GEO ne se joue pas pareil partout. Le facteur entre le secteur le plus aligné et le moins aligné atteint 4,3×, et aucune moyenne ne rattrape un tel écart.

SecteurRecouvrement SEO / GEO (Jaccard)Pages citées hors top Google
Finance0,59528 %
Santé, nutrition0,41244 %
Énergie, habitat0,39849 %
Tourisme, voyage0,19668 %
Beauté0,13870 %
Recherches locales0,13879 %

Dans la finance, bien se classer sur Google tire mécaniquement la visibilité dans les réponses générées : les deux surfaces avancent ensemble, les sources de référence y étant peu nombreuses et institutionnelles. Dans le tourisme, la beauté ou les recherches locales, un excellent classement ne garantit presque rien côté moteur génératif.

Entre les deux, la santé et l'énergie forment une zone intermédiaire où l'autorité se partage entre institutions, médias spécialisés et éditeurs privés. Et sur les recherches locales, Google My Business pèse souvent autant que le classement organique. Et vous, vous savez dans quel secteur se situe votre client ?

0%20%40%60%80%Valeur59,5%41,2%39,8%19,6%13,8%13,8%28,0%44,0%49,0%68,0%70,0%79,0%FinanceSanté, nutritionÉnergie, habitatTourisme, voyageBeautéRecherches localesRecouvrement SEO/GEO (Jaccard)Pages citées hors top Google
Six secteurs, deux mesures : l'indice de Jaccard SEO/GEO et la part de pages citées hors top 20 Google.

Trois moteurs,

Trois moteurs, pas un bloc

L'erreur la plus répandue consiste à parler des moteurs génératifs comme d'un seul interlocuteur à convaincre. Les 182 requêtes posées simultanément aux trois moteurs disent le contraire : 2,4 % de consensus triple. Sur 100 sources citées par Perplexity, à peine deux à trois sont aussi citées par ChatGPT et par Gemini.

Paire par paire, le recouvrement reste très bas. Perplexity et ChatGPT : Jaccard 0,034, médiane à 0,000. Perplexity et Gemini : 0,117. ChatGPT et Gemini : 0,035. Nous avions posé le seuil de convergence à 0,30 avant de mesurer. Aucune paire ne l'atteint.

Perplexity / ChatGPT (Jaccard)0,034
Perplexity / Gemini (Jaccard)0,117
ChatGPT / Gemini (Jaccard)0,035

Gemini produit à lui seul 14,6 URL par requête que Perplexity ne voit pas. Et sur 1 287 citations Gemini, 5,1 % sont dans le top 20 Google, contre 11,6 % pour Perplexity. Gemini s'écarte donc plus du classement que Perplexity, alors qu'il a le même éditeur que le moteur de recherche.

Il n'existe donc pas de réglage unique qui satisfasse les trois moteurs. Pour arbitrer, l'ordre de grandeur des audiences françaises aide : selon Médiamétrie, en septembre 2025, ChatGPT totalise 21,6 millions de visiteurs uniques mensuels, Gemini 2,8 millions et Perplexity 1,3 million.

ChatGPT (visiteurs uniques mensuels)21,6 millions
Gemini (visiteurs uniques mensuels)2,8 millions
Perplexity (visiteurs uniques mensuels)1,3 million
0,000,030,050,080,100,130,03Perplexity / ChatGPT0,12Perplexity / Gemini0,04ChatGPT / GeminiIndice de Jaccard
Sur 182 requêtes communes, aucune paire de moteurs ne dépasse un recoupement de sources de 0,12.

Bing ChatGPT

Bing et ChatGPT : le chiffre que nous corrigeons

Le conseil qu'on entend partout : ChatGPT utilise Bing pour sa recherche web, donc optimisez aussi pour Bing. Nous l'avons testé avec un corpus séparé d'environ 1 127 requêtes Bing, en juin 2026, et publié un recouvrement Google↔Bing de 1,57 % au niveau domaine.

Ce chiffre était faux, et nous le retirons. Il s'est révélé être un artefact de notre chaîne de collecte, pas une propriété de l'index Bing : le fournisseur de données interrogé rendait des pages dégradées sur une partie du corpus, ce que notre traitement d'alors ne détectait pas.

Un retest en juillet 2026, sur 169 requêtes stratifiées par secteur et par intention, donne un recouvrement réel de 11 à 12 %. L'écart est d'un ordre de grandeur, et nous préférons l'écrire que le laisser disparaître d'une version à l'autre.

Ce que le retest apporte ensuite compte davantage que la correction. 82 % des domaines communs à Perplexity et à Bing étaient déjà visibles dans le top 20 Google. Le complément net tombe donc à environ 18 %, soit 0,24 domaine additionnel par requête. Un appoint mesurable, pas un second gisement.

Recouvrement Google-Bing publié initialement1,57 %
Recouvrement réel après retest11 à 12 %
Domaines déjà dans le top 20 Google82 %
Complément net18 %
Domaine additionnel par requête0,24

La conclusion pratique change de nature sans changer de sens. Optimiser pour Bing n'est pas absurde, comme le laissait croire notre premier relevé : c'est un travail à faible rendement, parce que l'essentiel de ce que Bing apporte, la recherche Google le montrait déjà.

Reste une limite à assumer. Nous n'avons pas testé ce que cite réellement ChatGPT, nous avons comparé deux pages de résultats. Ce conseil demande une vérification directe, prévue en phase 2.

GEO français

Le GEO français n'est pas le GEO américain

Deux différences structurelles séparent ce que nous observons en France de ce que racontent les guides traduits de l'anglais.

Les sources citées ne sont pas les mêmes

Les recommandations américaines poussent vers Reddit et les contenus d'utilisateurs comme source reine du GEO. Sur notre corpus, les domaines les plus repris par Perplexity hors top Google sont des encyclopédies comme Wikipédia, des sites institutionnels comme service-public.gouv.fr, et des références reconnues dans leur matière. Pas des forums communautaires.

L'explication tient probablement à la structure du web francophone, moins riche en volume conversationnel indexable. Une hypothèse, pas un résultat de notre mesure.

Le mythe llms.txt

Malgré sa présence dans la quasi-totalité des guides, aucun crawler majeur n'exploite ce fichier en production à ce jour, et Google a indiqué publiquement ne pas le prendre en charge. Un standard évoqué partout, appliqué nulle part.

Le travail utile sur les robots est plus simple : vérifiez que votre robots.txt n'interdit pas les agents de collecte, et décidez du sort de google-extended, qui permet à Google d'utiliser vos contenus pour Gemini sans toucher au classement. Une décision d'entreprise, pas un réglage neutre.

L'IA travail

L'IA dans le travail SEO : ce qu'elle fait, ce qu'elle ne fait pas

L'autre moitié de la question seo ia concerne l'outillage quotidien. Nous n'avons ici aucune mesure propriétaire, donc aucun gain chiffré à présenter. Ce que nous pouvons décrire, c'est la répartition des tâches observée sur nos propres contenus.

Un modèle produit vite une trame et des angles à partir d'un sujet. L'usage le plus fiable : l'erreur y coûte peu et se voit tout de suite.
Utilisez un modèle pour le premier jet si vous fournissez le cadre : termes structurants, sources, position à tenir. Sans ce cadre, le texte est plausible et creux.
Croiser un export Google Search Console avec Google Analytics, repérer les pages qui perdent des impressions, regrouper des requêtes par intention : ce sont des tâches de traitement, et l'automatisation y est légitime.
Trouver les pages d'un site qui traitent le même sujet demande de comparer des dizaines de textes. Un traitement sémantique le fait plus vite qu'une lecture humaine.
Le jugement sur ce qui mérite d'être publié, la vérification des faits, l'expertise, la voix de la marque. Un modèle n'a pas la capacité de savoir ce que votre entreprise a le droit d'affirmer.

Le risque n'est pas la qualité du texte généré, il est ailleurs. Un contenu produit sans expertise ressemble à tous les autres, donc n'apporte aucune valeur au moteur qui le lit. Les algorithmes de classement comme les modèles de langage récompensent l'information qui n'existe pas déjà partout. Une assistance à la production, pas une délégation.

outils IA,

Les outils IA, et ce qu'ils voient

Le marketing digital a produit une abondance d'outils en dix-huit mois, et la question « quels sont les meilleurs outils » a moins d'intérêt qu'il n'y paraît. La bonne question : sur quelles données cet outil s'appuie-t-il, et que peut-il donc voir ?

Outils d'optimisation sémantique

Semawriter, Semji, YourTextGuru ou Surfer SEO travaillent le contenu à partir d'un corpus de pages concurrentes.

Outils de suivi de citations

Ils interrogent les moteurs génératifs pour savoir si une marque apparaît - le panorama de ces outils, famille par famille, est dressé ailleurs.

Générateurs de texte

Ils produisent la matière et ne mesurent rien.

Les fonctionnalités se ressemblent d'un outil à l'autre ; le corpus de référence, non. Un outil calibré sur un index générique ne voit pas les mêmes termes structurants qu'un outil calculé sur la SERP du jour en français. Sur 1 500 mots, l'écart de couverture entre un modèle NLP français natif et un modèle adapté représente 10 à 15 %.

Un audit outillé prend en charge la partie mécanique : identifier les termes attendus, mesurer la couverture, repérer la sur-optimisation. La décision reste la vôtre. Un outil vous aide à rédiger, pas à savoir quoi rédiger.

mesure ne

Ce que cette mesure ne prouve pas

Environ 25 % des mentions changent tous les 20 jours sur Perplexity. Un relevé donne un instantané, pas une tendance : deux collectes à trois semaines d'écart peuvent différer d'un quart sans qu'aucun contenu ait bougé.
Le taux d'attributions erronées se situe autour de 4 %, et monte à 10 à 12 % avec des critères stricts. Une citation peut désigner une page qui ne dit pas ce que la réponse affirme. Nous comptons des citations, pas des validations.
Un ρ de −0,997 mesure une association, il ne dit pas que le rang Google cause la citation. Les deux peuvent dépendre d'un troisième facteur, l'autorité du domaine par exemple. Améliorer son classement reste le levier le plus rationnel, sans garantie de citation.
Requêtes informationnelles, en français, sur 29 secteurs. Nous n'avons mesuré ni les requêtes transactionnelles, ni les AI Overviews, ni les images et vidéos citées. Rien de tout cela ne se transpose à un corpus anglophone sans nouvelle mesure.
Être cité n'est pas un clic, et un clic n'est pas une conversion. La visibilité mesurée ici est une surface, pas un revenu. Nécessaire, pas suffisant.

ça change

Ce que ça change pour votre stratégie

Quatre conséquences pratiques, sans formule magique.

Le SEO classique reste la fondation

Une marque qui juge sa présence en ligne au seul trafic organique ignore les 48,5 % de pages citées hors de tout top 20 Google. La méthode pour articuler les deux surfaces dans une même stratégie est détaillée dans notre guide.

La grille sectorielle passe avant la checklist

Agence ou équipe interne, mieux vaut une revue par secteur qu'une liste de critères recopiée d'un guide américain : l'écart est de 4,3×.

Bing et llms.txt sont des priorités basses

Notre retest le chiffre : 0,24 domaine additionnel par requête, et aucun crawler majeur pour llms.txt. L'énergie est mieux investie sur l'autorité éditoriale.

Les passages autoportants comptent

Une réponse directe en tête de section est reprise plus facilement qu'un raisonnement déplié sur six paragraphes. Un facteur parmi d'autres, pas un levier unique.

Cette étude est la phase 1 d'une démarche continue. Perplexity a été analysé en premier parce qu'il est le plus search-native. ChatGPT et Gemini font l'objet de la phase 2, avec les AI Overviews, dont l'arrivée en France a été annoncée pour septembre 2026 par Abondance. Un module GEO de mesure des citations est en cours de calibrage dans Semawriter.

Pour recevoir les résultats de la phase 2 dès leur sortie : s'inscrire au Mémo Sémantique →. Candidater à la bêta privée est l'autre porte d'entrée, avec 100 premiers accès et un accès progressif.

FAQ

Questions fréquentes

On l'appelle le plus souvent GEO, pour Generative Engine Optimization, terme issu du papier de Princeton présenté à KDD 2024. Deux variantes circulent : AEO, Answer Engine Optimization, centrée sur les moteurs de questions-réponses, et LLMO, qui insiste sur les modèles de langage. Le référencement IA désigne la même chose en français courant. Aucun de ces sigles ne remplace le SEO : il s'agit d'une surface supplémentaire, mesurée autrement.
La question porte moins sur le modèle que sur le besoin. Pour analyser des données de recherche et regrouper des requêtes, n'importe quel modèle généraliste récent fait le travail. Pour produire du contenu calibré sur une SERP française, un outil branché sur un corpus concurrent réel vaut mieux qu'un modèle seul. Semawriter laisse le choix du fournisseur - Gemini, Claude, Mistral ou OpenAI - configurable par projet.
Il est double. Sur la visibilité, une réponse générée s'intercale entre la requête et votre site : 48,5 % des pages citées par Perplexity sont hors du top 20 Google, donc le classement ne décrit plus à lui seul une présence en ligne. Sur les méthodes, l'analyse et la production s'automatisent en partie, ce qui déplace la valeur vers l'expertise. Le SEO reste la base, pas la totalité de la stratégie.
Il n'existe pas encore d'outil aussi simple que Google Search Console pour les moteurs génératifs. La méthode la plus fiable reste la collecte régulière de réponses sur un échantillon représentatif du secteur, comme les 1 042 cas analysés ici. Comptez une centaine de requêtes suivies, et un intervalle inférieur à trois semaines, l'instabilité mesurée étant de 25 % tous les 20 jours.
Cette étude ne mesure pas un délai d'optimisation, mais une association à un instant donné. L'écart sectoriel observé suggère que le rythme dépend du secteur et du type de source qui y fait autorité, pas d'un calendrier universel. Un contenu déjà bien classé peut être cité rapidement ; un contenu qui doit d'abord gagner son classement suit le calendrier du SEO, étape par étape.
Une recherche par mot-clé vise un terme précis et attend une liste de pages. Une recherche conversationnelle ressemble à un prompt : du contexte, une contrainte, parfois plusieurs questions. Le moteur interprète cette intention avant de chercher ses sources. Conséquence sur l'expérience de lecture : une page doit répondre à des questions formulées en langage naturel, section par section, pas seulement contenir les bons termes.