Semawriter
Optimisation sémantique : un calcul, pas une intuition
Optimisation sémantique : ce que BM25, TF-IDF et le NLP français calculent, comment se construit une fourchette cible, et ce que le score ne dit pas.
La densité de mots-clés a cessé de décider quoi que ce soit il y a plus de dix ans. Google Colibri en 2013, puis BERT en 2019, ont appris aux moteurs de recherche à interpréter le contexte d'une phrase plutôt qu'à compter les répétitions d'une expression.
Ce qui a remplacé la densité n'est pas une intuition, c'est un calcul. L'optimisation sémantique mesure l'écart entre le vocabulaire d'un texte et celui des pages déjà positionnées sur la même requête, terme par terme, avec une fourchette cible pour chacun.
Cette page décrit ce calcul : d'où vient le corpus, ce que BM25 et TF-IDF pondèrent, comment une fourchette cible se construit, ce que le NLP français change, et ce que le score obtenu ne dit pas. Peu d'outils publient ce détail. Chez Semawriter, la formule est versionnée publiquement, V3.1. Pas de boîte noire.
Optimisation sémantique
Optimisation sémantique : définition opérationnelle
L'optimisation sémantique fait correspondre le champ lexical d'un contenu à celui que les moteurs de recherche associent à une intention de recherche. Elle porte sur le sens et sur les relations entre concepts plutôt que sur la fréquence d'un mot-clé principal. L'objectif est la pertinence perçue par le moteur, et la visibilité qui en découle.
Trois notions se confondent souvent, et les distinguer aide à comprendre ce qu'un outil mesure réellement. Le champ lexical regroupe les mots liés à un même thème par leur forme et leur usage : pour « vélo électrique », ce sont autonomie, batterie, assistance, couple. Le champ sémantique décrit l'ensemble des sens que peut prendre un même mot selon le contexte. La recherche sémantique désigne la façon dont un moteur interprète une requête en fonction de l'intention qu'il lui prête, et non de sa formulation littérale.
On parle indifféremment d'optimisation sémantique SEO ou de SEO sémantique : la méthode est la même, seul le point d'entrée change. En pratique, le travail se réduit à trois questions.
- Quels termes les pages positionnées emploient-elles toutes.
- À quelle fréquence.
- Lesquels manquent à votre texte.
Le reste, l'arborescence du site, le maillage interne, le cocon sémantique, relève de l'architecture éditoriale d'un site, un sujet distinct que couvre la méthode d'audit sémantique.
Un point mérite d'être posé tout de suite : il ne s'agit pas d'écrire pour un algorithme. Les termes clés qu'un corpus impose sont ceux qu'un lecteur informé attend de toute façon sur le sujet, y compris ceux qu'il n'aurait pas su nommer. Un texte complet est un texte qui répond, pas un texte qui coche.
Pourquoi sémantique
Pourquoi la sémantique a remplacé la densité
Le référencement naturel des années 2000 reposait sur une règle simple et fausse : répéter l'expression cible un certain nombre de fois pour signaler le sujet de la page. La règle a fonctionné tant que les moteurs comptaient des chaînes de caractères, et le référencement se résumait alors à cette arithmétique.
Deux mises à jour ont fermé cette porte. Colibri, en 2013, a fait passer Google de la correspondance de mots à l'interprétation de la requête entière. BERT, en 2019, a ajouté la compréhension du contexte bidirectionnel : le rôle d'un mot y dépend de ce qui le précède et de ce qui le suit dans la phrase.
La conséquence est directe pour la rédaction web. Une page qui répète trente fois son expression principale sans aborder les concepts connexes est identifiée comme pauvre, quand une page qui traite le sujet dans toute son étendue se positionne sans forcer la répétition. La sur-optimisation est devenue un signal négatif là où elle était un levier.
Ce déplacement se lit directement dans les résultats. Les featured snippets et le bloc People Also Ask affichent des extraits choisis pour leur pertinence à une question précise, pas pour leur densité. Un contenu sémantique riche y accède, un texte répétitif non.
Le déplacement porte aussi sur ce qu'on mesure. Une densité se calcule sur un texte isolé ; une couverture sémantique se calcule par comparaison à un ensemble de concurrents. Cela change l'approche : on n'améliore plus un texte dans l'absolu, on le compare à une SERP précise, un jour précis.
Comment score
Comment un score sémantique se calcule
C'est la partie que la plupart des outils laissent dans l'ombre. Le calcul enchaîne cinq opérations, toutes descriptibles sans rien révéler de confidentiel.
- Constituer le corpus de référence. Le moteur interroge la SERP sur votre requête et crawle les pages du top 10 au moment de l'analyse. Ce corpus est la seule autorité du calcul : il représente ce que Google valide aujourd'hui.
- Normaliser la langue. Chaque texte est découpé en unités, puis chaque forme fléchie est ramenée à son lemme, « optimisait », « optimisions » et « optimiser » comptent pour un même terme. Les entités nommées sont isolées à ce stade : une marque, un lieu ou un algorithme connu ne sont pas des mots communs et ne se pondèrent pas comme tels.
- Pondérer les termes. Deux algorithmes complémentaires travaillent ici. BM25 identifie les termes à la fois fréquents dans une page et distinctifs par rapport aux autres, ce sont les termes structurants, ceux qui définissent réellement le sujet. TF-IDF capture les spécificités de chaque concurrent, c'est-à-dire ce qu'un seul document apporte et que les autres n'ont pas.
- Construire la fourchette cible de chaque terme. La distribution des occurrences du terme à travers les pages du corpus donne un minimum, une médiane et un maximum. La fourchette cible se dessine autour de cette médiane.
- Agréger. Chaque terme reçoit un état, couvert, insuffisant, absent, excédentaire, pondéré par son poids dans le corpus. Un terme structurant absent coûte beaucoup plus qu'un terme de niche manquant. La somme de ces états, ramenée sur cent, donne le score.
Chaque étape est reproductible : deux analyses lancées le même jour sur la même requête produisent le même corpus.
Deux précisions avant d'utiliser un score. La mise en forme n'entre pas dans le calcul : mettre un terme en gras ne rapporte rien, seule son occurrence compte. Et le score dépend d'une formule qui évolue, d'où l'intérêt d'une version publique, qui dit si un score a progressé parce que le texte s'est amélioré ou parce que les pondérations ont changé.
fourchette cible
La fourchette cible vient du corpus, pas d'une règle
C'est le point qui sépare deux générations d'outils. Les recommandations du type « employez cette expression trois à cinq fois » supposent une norme universelle. Il n'y en a pas.
La fourchette cible d'un terme est calculée sur le corpus concurrent du jour. Un exemple : si les dix pages positionnées sur votre requête emploient « champ lexical » entre trois et huit fois, votre fourchette est trois à huit. Sur une autre requête, le même terme aura une autre fourchette, ou disparaîtra de la liste.
La borne haute a autant d'importance que la borne basse. Dépasser le maximum observé chez les concurrents est un signal de sur-optimisation : le texte s'écarte de ce que le corpus valide, dans un sens que les moteurs de recherche savent détecter depuis longtemps. Un terme employé quinze fois quand la médiane est à quatre dessert la page.
La conséquence pratique se remarque vite. Un texte optimisé sur une SERP de janvier peut être devenu incomplet en juillet, sans qu'une ligne ait changé, parce que de nouveaux concurrents ont fait entrer d'autres concepts dans le corpus. La couverture sémantique est une position relative, pas un acquis.
français natif
Ce que le français natif change
La plupart des outils d'analyse sémantique ont été conçus pour l'anglais, puis adaptés. L'écart se mesure : sur 1 500 mots en français, la différence de couverture entre un modèle FR natif et un modèle adapté depuis l'anglais atteint 10 à 15 %.
Trois difficultés expliquent cet écart, et elles sont toutes linguistiques.
- La variation des formes. Le français conjugue, accorde et accentue davantage que l'anglais. Un modèle mal entraîné compte « optimisé », « optimisée » et « optimisés » comme trois termes différents, et traite « sémantique » et « semantique », qui coexistent dans les contenus web français, comme deux entrées.
- Les groupes figés. « Intention de recherche », « longue traîne », « maillage interne » fonctionnent comme des unités de sens. Un modèle qui les découpe perd l'information et distribue du poids à des mots-outils.
- Les noms propres du secteur. Une marque comme Semji, un modèle comme BERT ou un nom de lieu ne relèvent pas du vocabulaire courant. La qualité de cette reconnaissance dépend directement du corpus d'entraînement.
Chez Semawriter, le traitement du langage est assuré par spaCy fr_core_news_lg, entraîné sur des corpus journalistiques et encyclopédiques français. Le modèle est nommé parce qu'il est vérifiable, c'est une brique identifiable, pas un argument.
outils
Les outils
Le marché francophone compte plusieurs solutions matures : Semji, YourTextGuru, Thot SEO, 1.fr, SEOQuantum, TextFocus, auxquelles s'ajoutent les modules de rédaction des suites généralistes comme Semrush. Toutes cherchent à identifier les mots-clés pertinents d'un sujet et à mesurer ce qu'un texte en couvre. Intégrer l'un d'eux à une stratégie de contenu existante prend peu de temps ; leur utilisation quotidienne, elle, diffère nettement.
Quatre critères permettent de les comparer utilement, indépendamment de la liste des fonctionnalités.
- L'origine du corpus. Crawl en temps réel de la SERP du jour, ou index préconstitué mis à jour périodiquement. La différence se voit sur les sujets qui bougent vite.
- La langue de calibrage. Modèle entraîné sur des données françaises, ou modèle anglophone adapté. C'est le critère qui produit l'écart de 10 à 15 %.
- La transparence de la formule. Une version publiée permet d'interpréter une variation de score. Sans elle, une hausse peut venir du texte comme d'un recalibrage invisible.
- Le mode de travail. Score recalculé pendant l'écriture, ou analyse à la demande après coup. Le premier change la façon de rédiger, le second sert surtout au contrôle.
Aucun guide complet ne remplace un essai sur vos propres requêtes : c'est là que se voit la différence entre deux corpus. Un rédacteur SEO et une équipe marketing n'attendent d'ailleurs pas la même chose d'un outil, le premier veut écrire mieux, la seconde veut créer plus vite.
Semawriter applique les principes décrits sur cette page : corpus crawlé sur la SERP française du jour, BM25 et TF-IDF, NLP français natif, score recalculé au fil de la rédaction, formule versionnée. Du mot-clé au texte publié en 30 minutes, contre 30 à 45 minutes rien que pour construire le brief à la main.
score ne
Ce que le score ne dit pas
Il ne prédit pas un classement. La couverture sémantique est un signal parmi d'autres, aux côtés de l'autorité du domaine, des liens entrants et de la santé technique du site. Un texte bien couvert sur un domaine jeune ne passera pas mécaniquement devant un texte moins couvert sur un domaine installé. Nécessaire, pas suffisant.
Il ne juge pas l'écriture. Un texte peut atteindre une couverture élevée et rester plat, redondant, sans angle. Le score ne mesure ni le rythme, ni la clarté, ni l'expertise réelle de son auteur. Ces qualités relèvent du rédacteur, et rien ne les remplace.
Il ne vérifie pas les faits. Un contenu sémantiquement complet peut être inexact. Le calcul porte sur des occurrences de termes, jamais sur la véracité des informations avancées ni sur la qualité des sources citées.
Il ne dit rien de l'expérience utilisateur. La lisibilité sur mobile, la vitesse d'affichage, la clarté du menu de navigation se jouent hors du texte et pèsent également sur le trafic. Un contenu bien couvert sur une page lente reste une page lente.
Il ne remplace pas l'intention. Si les pages positionnées sur votre requête sont des comparatifs et que vous publiez une définition, un bon score ne corrigera pas l'erreur de format. La lecture des résultats précède la rédaction.
FAQ
Questions fréquentes
Écrire avec
Écrire avec le corpus sous les yeux
Semawriter crawle le top 10 de la SERP française du jour, extrait les termes structurants avec leur fourchette cible et recalcule le score pendant que vous écrivez. Bêta privée, 100 premiers accès · accès progressif · −30 % à vie · NLP français natif · hébergé en Europe.