| Secteur | Recouvrement SEO / GEO (Jaccard) | Pages citées hors top Google |
|---|---|---|
| Finance | 0,595 | 28 % |
| Santé, nutrition | 0,412 | 44 % |
| Énergie, habitat | 0,398 | 49 % |
| Tourisme, voyage | 0,196 | 68 % |
| Beauté | 0,138 | 70 % |
| Recherches locales | 0,138 | 79 % |
Semawriter
SEO IA : 48,5 % des pages citées sont hors du top 20 Google
Étude française sur 1 042 requêtes : 48,5 % des pages citées par Perplexity sont hors du top 20 Google. Écart sectoriel et relevé Bing corrigé.
48,5 % des pages que Perplexity reprend dans ses réponses sont absentes du top 20 Google de la requête posée. Le chiffre vient d'une mesure directe sur un corpus français, pas d'une extrapolation depuis un marché anglophone.
Tous les conseils qui circulent en français sur le référencement naturel à l'ère de l'intelligence artificielle viennent du même endroit : les études américaines, traduites ou paraphrasées. Le papier fondateur de Princeton, présenté à KDD 2024, puis des recommandations qu'on recopie sans vérifier si elles tiennent en France. Bing pour ChatGPT, Reddit comme source reine, llms.txt comme nouveau standard.
Nous avons donc mesuré, plutôt que recopié. Entre juin et juillet 2026, le module de mesure Semawriter a collecté 1 139 snapshots Perplexity sur 1 042 requêtes informationnelles françaises, réparties sur 29 secteurs. 8 413 citations de pages uniques en sont sorties, croisées avec les positions Google sur les mêmes requêtes. Fin juin 2026, 182 de ces requêtes ont été posées simultanément à Perplexity, ChatGPT et Google Gemini.
Une précision avant les résultats. Cette étude porte d'abord sur Perplexity, le moteur le plus search-native au moment de la collecte. Et une de nos estimations publiées s'est révélée fausse : nous la corrigeons plus bas, en la nommant.
SEO IA
SEO IA : deux questions, pas une
L'expression seo ia recouvre deux demandes distinctes, et les confondre fait perdre du temps. La première : comment un site reste visible quand une réponse générée s'intercale avant les résultats de recherche. La seconde : comment l'intelligence artificielle sert le travail de référencement naturel au quotidien, de la recherche de mots-clés à la création de contenu.
Cette page traite les deux, en commençant par celle sur laquelle nous avons des données propriétaires. La seconde relève de la pratique outillée, et nous l'abordons sans chiffre que nous n'aurions pas mesuré.
Un point de vocabulaire, parce que le sigle circule mal. GEO signifie Generative Engine Optimization, parfois écrit GÉO en français : l'optimisation pour ces moteurs-là, pas pour la page de résultats Google. Search Engine Optimization, le SEO, désigne le référencement des moteurs de recherche classiques, celui qu'on pratique depuis vingt ans. Answer Engine Optimization, ou AEO, désigne une variante centrée sur les moteurs de questions-réponses.
Comment fonctionne
Comment fonctionne la recherche par IA générative
Ces moteurs ne renvoient pas une liste de liens. Ils produisent une réponse à partir de plusieurs sources, puis citent - ou non - certaines pages du web. ChatGPT, Gemini, Claude et Mistral reposent chacun sur leur propre mécanisme de récupération d'information, pas sur un index commun. Un modèle de langage extrait les passages qu'il juge pertinents, puis décide ce qui mérite d'être repris devant l'internaute. Comprendre cette mécanique est le préalable de toute optimisation, sur un site web marchand comme sur un site internet institutionnel.
Méthodologie
Méthodologie : ce qu'on a vraiment mesuré
Le corpus s'appuie sur 1 042 requêtes informationnelles réparties sur 29 secteurs de l'économie française : e-commerce, santé, finance, tourisme, immobilier, énergie, entre autres. Une requête n'y entre que si elle admet une réponse documentaire, pas transactionnelle.
On a collecté 1 139 snapshots, sans une seule erreur de collecte. Ça donne 24 150 lignes d'analyse, croisant ce que Perplexity reprend avec les résultats de recherche Google sur les mêmes requêtes. Les 8 413 pages citées ont été vérifiées une par une avant d'entrer dans le traitement.
Le détail qui change tout : 14 062 lignes de groupe de contrôle. Des pages bien classées sur Google, jamais reprises par Perplexity. On ne regarde pas seulement ce qui est cité, on regarde aussi ce qui aurait pu l'être et ne l'est pas. Les questions du type People Also Ask ont servi à recouper les intentions réelles.
Le recouvrement entre deux ensembles de sources est mesuré par l'indice de Jaccard - une mesure de l'intersection entre deux ensembles, comprise entre 0, aucune source commune, et 1, sources identiques. Nous mesurons un recouvrement de pages, pas de domaines.
gradient
Le gradient : la corrélation la plus nette qu'on ait observée
Premier résultat, et il est sans appel. La corrélation de Spearman entre le rang d'un site dans la recherche Google et sa probabilité d'être repris par Perplexity atteint ρ = −0,997 (p < 0,0001). Quasi parfaite.
La pente est linéaire. Aucune zone de rupture, aucun palier. Une page en première position a dix fois plus de chances d'être citée qu'une page en vingtième.
Pour qui arbitre son budget, le classement reste donc un socle de la visibilité dans les moteurs IA. Une corrélation forte, pas un mécanisme démontré.
Seulement, ce lien n'est pas absolu. Et c'est là que ça devient intéressant.
décorrélation
La décorrélation : le rang ne fait pas tout
48,5 % des pages citées sont absentes du top 20 Google. Presque une sur deux échappe totalement au classement traditionnel. 39,2 % se trouvent dans le top 10, 12,2 % dans le top 11-20.
Autrement dit, le SEO classique couvre 51,4 % des citations Perplexity sur notre corpus. La moitié du tableau. L'autre moitié se joue sur un index distinct de celui de Google, alimenté et rafraîchi selon ses propres règles.
La conséquence est symétrique et rarement dite. Être numéro 1 dans la recherche Google n'ouvre aucun droit à la citation, et un site abondamment repris dans les réponses générées ne remonte pas pour autant dans le classement. Deux surfaces, deux tris - une même stratégie éditoriale.
L'écart sectoriel
L'écart sectoriel : une calibration, pas une recette
C'est ici que tout se décide. Le GEO ne se joue pas pareil partout. Le facteur entre le secteur le plus aligné et le moins aligné atteint 4,3×, et aucune moyenne ne rattrape un tel écart.
Dans la finance, bien se classer sur Google tire mécaniquement la visibilité dans les réponses générées : les deux surfaces avancent ensemble, les sources de référence y étant peu nombreuses et institutionnelles. Dans le tourisme, la beauté ou les recherches locales, un excellent classement ne garantit presque rien côté moteur génératif.
Entre les deux, la santé et l'énergie forment une zone intermédiaire où l'autorité se partage entre institutions, médias spécialisés et éditeurs privés. Et sur les recherches locales, Google My Business pèse souvent autant que le classement organique. Et vous, vous savez dans quel secteur se situe votre client ?
Trois moteurs,
Trois moteurs, pas un bloc
L'erreur la plus répandue consiste à parler des moteurs génératifs comme d'un seul interlocuteur à convaincre. Les 182 requêtes posées simultanément aux trois moteurs disent le contraire : 2,4 % de consensus triple. Sur 100 sources citées par Perplexity, à peine deux à trois sont aussi citées par ChatGPT et par Gemini.
Paire par paire, le recouvrement reste très bas. Perplexity et ChatGPT : Jaccard 0,034, médiane à 0,000. Perplexity et Gemini : 0,117. ChatGPT et Gemini : 0,035. Nous avions posé le seuil de convergence à 0,30 avant de mesurer. Aucune paire ne l'atteint.
Gemini produit à lui seul 14,6 URL par requête que Perplexity ne voit pas. Et sur 1 287 citations Gemini, 5,1 % sont dans le top 20 Google, contre 11,6 % pour Perplexity. Gemini s'écarte donc plus du classement que Perplexity, alors qu'il a le même éditeur que le moteur de recherche.
Il n'existe donc pas de réglage unique qui satisfasse les trois moteurs. Pour arbitrer, l'ordre de grandeur des audiences françaises aide : selon Médiamétrie, en septembre 2025, ChatGPT totalise 21,6 millions de visiteurs uniques mensuels, Gemini 2,8 millions et Perplexity 1,3 million.
Bing ChatGPT
Bing et ChatGPT : le chiffre que nous corrigeons
Le conseil qu'on entend partout : ChatGPT utilise Bing pour sa recherche web, donc optimisez aussi pour Bing. Nous l'avons testé avec un corpus séparé d'environ 1 127 requêtes Bing, en juin 2026, et publié un recouvrement Google↔Bing de 1,57 % au niveau domaine.
Ce chiffre était faux, et nous le retirons. Il s'est révélé être un artefact de notre chaîne de collecte, pas une propriété de l'index Bing : le fournisseur de données interrogé rendait des pages dégradées sur une partie du corpus, ce que notre traitement d'alors ne détectait pas.
Un retest en juillet 2026, sur 169 requêtes stratifiées par secteur et par intention, donne un recouvrement réel de 11 à 12 %. L'écart est d'un ordre de grandeur, et nous préférons l'écrire que le laisser disparaître d'une version à l'autre.
Ce que le retest apporte ensuite compte davantage que la correction. 82 % des domaines communs à Perplexity et à Bing étaient déjà visibles dans le top 20 Google. Le complément net tombe donc à environ 18 %, soit 0,24 domaine additionnel par requête. Un appoint mesurable, pas un second gisement.
La conclusion pratique change de nature sans changer de sens. Optimiser pour Bing n'est pas absurde, comme le laissait croire notre premier relevé : c'est un travail à faible rendement, parce que l'essentiel de ce que Bing apporte, la recherche Google le montrait déjà.
Reste une limite à assumer. Nous n'avons pas testé ce que cite réellement ChatGPT, nous avons comparé deux pages de résultats. Ce conseil demande une vérification directe, prévue en phase 2.
GEO français
Le GEO français n'est pas le GEO américain
Deux différences structurelles séparent ce que nous observons en France de ce que racontent les guides traduits de l'anglais.
Les sources citées ne sont pas les mêmes
Les recommandations américaines poussent vers Reddit et les contenus d'utilisateurs comme source reine du GEO. Sur notre corpus, les domaines les plus repris par Perplexity hors top Google sont des encyclopédies comme Wikipédia, des sites institutionnels comme service-public.gouv.fr, et des références reconnues dans leur matière. Pas des forums communautaires.
L'explication tient probablement à la structure du web francophone, moins riche en volume conversationnel indexable. Une hypothèse, pas un résultat de notre mesure.
Le mythe llms.txt
Malgré sa présence dans la quasi-totalité des guides, aucun crawler majeur n'exploite ce fichier en production à ce jour, et Google a indiqué publiquement ne pas le prendre en charge. Un standard évoqué partout, appliqué nulle part.
Le travail utile sur les robots est plus simple : vérifiez que votre robots.txt n'interdit pas les agents de collecte, et décidez du sort de google-extended, qui permet à Google d'utiliser vos contenus pour Gemini sans toucher au classement. Une décision d'entreprise, pas un réglage neutre.
L'IA travail
L'IA dans le travail SEO : ce qu'elle fait, ce qu'elle ne fait pas
L'autre moitié de la question seo ia concerne l'outillage quotidien. Nous n'avons ici aucune mesure propriétaire, donc aucun gain chiffré à présenter. Ce que nous pouvons décrire, c'est la répartition des tâches observée sur nos propres contenus.
Le risque n'est pas la qualité du texte généré, il est ailleurs. Un contenu produit sans expertise ressemble à tous les autres, donc n'apporte aucune valeur au moteur qui le lit. Les algorithmes de classement comme les modèles de langage récompensent l'information qui n'existe pas déjà partout. Une assistance à la production, pas une délégation.
outils IA,
Les outils IA, et ce qu'ils voient
Le marketing digital a produit une abondance d'outils en dix-huit mois, et la question « quels sont les meilleurs outils » a moins d'intérêt qu'il n'y paraît. La bonne question : sur quelles données cet outil s'appuie-t-il, et que peut-il donc voir ?
Outils d'optimisation sémantique
Semawriter, Semji, YourTextGuru ou Surfer SEO travaillent le contenu à partir d'un corpus de pages concurrentes.
Outils de suivi de citations
Ils interrogent les moteurs génératifs pour savoir si une marque apparaît - le panorama de ces outils, famille par famille, est dressé ailleurs.
Générateurs de texte
Ils produisent la matière et ne mesurent rien.
Les fonctionnalités se ressemblent d'un outil à l'autre ; le corpus de référence, non. Un outil calibré sur un index générique ne voit pas les mêmes termes structurants qu'un outil calculé sur la SERP du jour en français. Sur 1 500 mots, l'écart de couverture entre un modèle NLP français natif et un modèle adapté représente 10 à 15 %.
Un audit outillé prend en charge la partie mécanique : identifier les termes attendus, mesurer la couverture, repérer la sur-optimisation. La décision reste la vôtre. Un outil vous aide à rédiger, pas à savoir quoi rédiger.
mesure ne
Ce que cette mesure ne prouve pas
ça change
Ce que ça change pour votre stratégie
Quatre conséquences pratiques, sans formule magique.
Le SEO classique reste la fondation
Une marque qui juge sa présence en ligne au seul trafic organique ignore les 48,5 % de pages citées hors de tout top 20 Google. La méthode pour articuler les deux surfaces dans une même stratégie est détaillée dans notre guide.
La grille sectorielle passe avant la checklist
Agence ou équipe interne, mieux vaut une revue par secteur qu'une liste de critères recopiée d'un guide américain : l'écart est de 4,3×.
Bing et llms.txt sont des priorités basses
Notre retest le chiffre : 0,24 domaine additionnel par requête, et aucun crawler majeur pour llms.txt. L'énergie est mieux investie sur l'autorité éditoriale.
Les passages autoportants comptent
Une réponse directe en tête de section est reprise plus facilement qu'un raisonnement déplié sur six paragraphes. Un facteur parmi d'autres, pas un levier unique.
Cette étude est la phase 1 d'une démarche continue. Perplexity a été analysé en premier parce qu'il est le plus search-native. ChatGPT et Gemini font l'objet de la phase 2, avec les AI Overviews, dont l'arrivée en France a été annoncée pour septembre 2026 par Abondance. Un module GEO de mesure des citations est en cours de calibrage dans Semawriter.
Pour recevoir les résultats de la phase 2 dès leur sortie : s'inscrire au Mémo Sémantique →. Candidater à la bêta privée est l'autre porte d'entrée, avec 100 premiers accès et un accès progressif.
FAQ