Mots-clés LSI : le mythe et ce qui compte vraiment

Mots-clés LSI : le mythe et ce qui compte vraiment

Tapez « mots-clés LSI » dans un moteur de recherche et vous tombez sur des dizaines d'outils promettant de générer une liste de termes « sémantiquement liés » à glisser dans votre article pour « plaire à l'algorithme ». Le problème : ce que ces outils vendent sous le nom LSI n'a presque rien à voir avec ce que ce sigle désignait à l'origine, et encore moins avec la façon dont un moteur de recherche évalue réellement un contenu aujourd'hui.

Cet article fait les deux choses que vous êtes venu chercher : démonter le mythe pour de bon, puis vous donner la méthode qui fonctionne réellement pour choisir les mots à mettre dans votre contenu, sans acheter un outil « LSI » de plus.

Le LSI, c'était quoi au juste ?

LSI signifie Latent Semantic Indexing, indexation sémantique latente, parfois appelée LSA pour Latent Semantic Analysis. C'est une technique mathématique de recherche d'information mise au point à la fin des années 1980, bien avant l'existence de Google. Elle appliquait une opération d'algèbre linéaire à une matrice recensant quels termes apparaissent dans quels documents, afin de repérer des relations entre des mots qui n'apparaissent jamais ensemble mais qui appartiennent pourtant au même thème.

Le détail important, presque toujours passé sous silence par le marketing SEO, c'est que le LSI a été conçu pour indexer une collection fermée de documents : une bibliothèque numérique, un fonds d'archives, un corpus universitaire de taille connue et fixe. Le web n'est pas une collection fermée. Il compte des dizaines de milliards de pages, en changement permanent, et rien n'indique qu'un moteur de recherche grand public ait jamais fait tourner du LSI classique sur un index de cette taille. La technique existe, elle est réelle, elle a des applications légitimes en recherche documentaire fermée. Elle n'a simplement jamais été l'outil qui décide de votre position sur « recette de tarte au citron ».

Recalculer une décomposition en valeurs singulières sur un corpus de la taille du web indexé, remis à jour en continu, représente un coût de calcul totalement disproportionné par rapport aux méthodes disponibles à l'époque de son invention. C'est une explication technique simple à un fait souvent présenté comme mystérieux : la technique est restée cantonnée à des usages de bibliothèques numériques et de moteurs de recherche d'entreprise sur corpus fixe, et n'est jamais devenue le socle du classement d'un moteur de recherche public consulté par des milliards de requêtes.

Comment le SEO en a fait un mythe, puis un produit

Le sigle a franchi la frontière du milieu académique vers le marketing SEO au moment où de nombreux sites se faisaient sanctionner pour bourrage de mots-clés après des mises à jour successives de l'algorithme de Google. Il fallait un nouveau discours : ne plus répéter le mot-clé principal à outrance, mais entourer le sujet de termes « sémantiquement proches ». LSI sonnait technique, scientifique, presque confidentiel, l'habillage parfait pour vendre un nouveau service à des clients échaudés par le keyword stuffing.

Des outils sont alors apparus, promettant de générer en un clic la liste des « mots-clés LSI » d'un sujet donné. En réalité, la plupart se contentent de récupérer des termes qui reviennent souvent dans les pages déjà bien classées, ou des suggestions d'autocomplétion, un travail utile en soi, mais qui n'a rien à voir avec un calcul d'indexation sémantique latente. Le nom empruntait une caution scientifique à une méthode qui, sous un autre nom, aurait été reconnue pour ce qu'elle est réellement : une observation empirique du champ lexical d'un sujet, pas un algorithme de classement.

Ce que les moteurs de recherche font réellement aujourd'hui

Des représentants de Google ont affirmé publiquement, à plusieurs reprises et depuis des années, que Google n'utilise pas de « mots-clés LSI » et qu'aucune notion portant ce nom n'existe dans son système de classement. Ce n'est pas une nuance de vocabulaire : c'est un rejet net d'un concept qui n'a jamais eu de base technique réelle dans leur moteur.

Ce qui existe, en revanche, est plus sophistiqué qu'une liste de mots à cocher. Les moteurs modernes travaillent sur la compréhension du langage naturel : ils interprètent l'intention derrière une requête, identifient les entités qu'elle mentionne, qu'il s'agisse d'une marque, d'un lieu, d'un concept ou d'une personne, les relient entre elles, puis évaluent si une page répond réellement à cette intention, pas seulement si elle contient les bons mots au bon endroit. Ce travail repose sur des modèles de traitement du langage entraînés sur des volumes massifs de texte, pas sur un calcul de proximité entre deux colonnes d'un tableur.

Cette compréhension du langage ne fonctionne plus par correspondance exacte de chaînes de caractères, mais par représentation du sens des mots et des phrases sous une forme que le système peut comparer entre eux : deux formulations différentes d'une même intention finissent par être traitées comme proches, même si elles ne partagent presque aucun mot en commun. C'est ce qui permet à un moteur de recherche de relier une requête formulée maladroitement à une page qui y répond parfaitement sans jamais utiliser les mots exacts de la requête, une prouesse qu'une simple liste de synonymes ne pourrait jamais accomplir.

Conséquence directe : quand une page bien classée sur un sujet contient un vocabulaire riche et varié autour de ce sujet, ce n'est pas parce que son auteur a coché une liste de mots-clés LSI avant publication. C'est parce qu'en traitant le sujet sérieusement, en couvrant ses sous-thèmes, ses cas particuliers, son vocabulaire technique, on emploie naturellement les termes qu'un expert du domaine emploierait spontanément. La co-occurrence de vocabulaire est un sous-produit d'un contenu complet, pas une checklist qu'on remplit pour obtenir ce contenu. Confondre la cause et la conséquence, c'est exactement l'erreur que vend un outil « LSI ».

La méthode concrète : où trouver les bons mots pour votre sujet

Oubliez le générateur magique. La méthode qui fonctionne prend une vingtaine de minutes, ne coûte rien, et donne des résultats bien plus fiables parce qu'elle observe ce qui se passe réellement sur le terrain plutôt que ce qu'un algorithme tiers estime « sémantiquement proche ».

Cette liste n'est pas un quota à remplir dans votre texte. C'est une carte des sous-thèmes que votre article doit couvrir pour répondre réellement à la requête. Si votre contenu traite ces sous-thèmes avec le vocabulaire naturel qui va avec, les mots que les outils appellent « LSI » apparaîtront tout seuls, parce que vous les aurez écrits en expliquant les choses correctement, pas en les insérant après coup.

  • Lisez les cinq à dix premières pages déjà classées sur votre requête cible, et notez le vocabulaire qu'elles partagent ainsi que les sous-thèmes qu'elles abordent toutes.
  • Parcourez le bloc des recherches associées en bas de la page de résultats : ce sont des requêtes réellement tapées par des internautes sur le même sujet, une meilleure source que n'importe quel outil payant.
  • Ouvrez les questions du type « autres questions posées » : chacune révèle un sous-thème que votre article devrait couvrir pour être considéré comme complet.
  • Tapez le début de votre requête cible dans la barre de recherche et observez les suggestions d'autocomplétion, elles montrent les intentions les plus fréquentes associées au terme.
  • Listez les entités que le sujet implique nécessairement : marques, outils, lieux, unités de mesure, étapes d'un processus, celles qu'un expert du domaine mentionnerait sans même y penser.

Un exemple concret : appliquer la méthode à un vrai sujet

Prenons un sujet volontairement éloigné du marketing pour que la méthode se voie clairement : « matelas de camping ». En lisant les pages déjà bien classées sur cette requête, un motif se dégage vite : elles parlent toutes d'isolation thermique et de valeur R, de poids et d'épaisseur une fois gonflé, de temps de gonflage, et de la différence entre un modèle autogonflant et un modèle gonflable manuellement. Aucune de ces pages n'a consulté d'outil « LSI » pour choisir ce vocabulaire ; il vient simplement du fait qu'on ne peut pas décrire un matelas de camping sérieusement sans ces notions.

Le bloc des questions fréquentes, sur ce même sujet, fait remonter des interrogations très concrètes : quel matelas choisir pour un usage hivernal, quelle différence de confort entre un modèle en mousse et un modèle gonflable, ou encore comment réparer une crevaison en pleine randonnée. L'autocomplétion, elle, révèle des variantes d'intention comme le matelas ultraléger pour la randonnée itinérante ou le modèle deux places pour un couple. Les entités qui reviennent sont des marques spécialisées, des unités de mesure comme le centimètre ou le gramme, et des standards du secteur comme la fameuse valeur R.

Un article qui couvre honnêtement ces sous-thèmes emploiera naturellement tout ce vocabulaire, dans le même ordre de fréquence que les pages qui rankent déjà, sans qu'aucune liste externe n'ait été nécessaire pour le « planifier ». C'est exactement ce mécanisme, observé sujet après sujet, qui donne l'illusion qu'un outil de mots-clés LSI « fonctionne » quand on l'utilise : il ne fait que refléter, après coup, ce que l'analyse manuelle de la page de résultats aurait montré directement.

Concrètement, cela veut dire qu'écrire « comment gonfler un matelas de camping rapidement » et « gonflage rapide d'un matelas gonflable de randonnée » peut être reconnu comme répondant à la même intention, alors qu'une checklist de mots-clés LSI aurait traité les deux formulations comme deux cases séparées à cocher.

Comment les utiliser sans tomber dans la sur-optimisation

Le risque, une fois qu'on dispose de cette liste de termes et de sous-thèmes, c'est de retomber dans le travers qu'on voulait justement éviter : cocher chaque mot dans le texte comme une checklist, cette fois avec un vocabulaire plus long et plus sophistiqué. Le résultat reste le même, un texte écrit pour un algorithme imaginaire plutôt que pour un lecteur qui cherche une réponse.

La bonne discipline consiste à écrire d'abord la meilleure réponse possible à la question posée par le lecteur, en couvrant les sous-thèmes identifiés parce qu'ils sont utiles, pas parce qu'ils figurent sur une liste. Relisez ensuite votre texte et demandez-vous, section par section, si chaque paragraphe apporte une information que le lecteur n'avait pas avant de le lire. Un article qui répond à toutes les sous-questions naturelles d'un sujet finit mécaniquement par employer le vocabulaire associé, sans qu'aucun effort de densité sémantique ne soit nécessaire de votre part.

Le vrai test n'est pas une liste, c'est la couverture du sujet

Si vous ne devez retenir qu'une seule idée de cet article, la voici : la question à se poser n'est jamais « ai-je assez de mots-clés LSI dans mon texte ? » mais plutôt « un lecteur qui cherche cette information trouverait-il, dans mon article, tout ce qu'il est venu chercher, et rien qu'il doive aller chercher ailleurs ? ». La première question mène à un texte truffé de synonymes forcés et de tournures artificielles. La seconde mène à un texte que le moteur de recherche, ses utilisateurs, et vous-même en tant que rédacteur, reconnaissez comme réellement complet.

Le terme LSI continuera probablement à circuler dans le vocabulaire SEO encore longtemps, parce qu'il a l'avantage d'être facile à vendre en une phrase. Mais vous savez désormais ce qu'il désignait vraiment, pourquoi il ne s'applique pas à un moteur de recherche moderne, et surtout ce qu'il faut faire à la place : lire ce qui est déjà bien classé, écouter les questions que posent réellement les internautes, et écrire pour eux en premier.

Questions fréquentes

Les outils de « mots-clés LSI » sont-ils complètement inutiles ?

Pas complètement : la plupart agrègent des données réelles, comme des co-occurrences ou des questions fréquentes, qui peuvent faire gagner du temps pour repérer des sous-thèmes. Le problème n'est pas la donnée qu'ils affichent, c'est l'idée qu'il faudrait ensuite « placer » ces mots comme un quota de densité. Utilisez-les, si vous le souhaitez, comme un raccourci vers la même carte de sous-thèmes que vous obtiendriez en lisant la page de résultats vous-même.

LSI et TF-IDF, est-ce la même chose ?

Non. TF-IDF, pour term frequency-inverse document frequency, est une autre technique de recherche d'information, plus ancienne et plus simple, qui pondère l'importance d'un mot dans un document par rapport à sa fréquence dans l'ensemble du corpus. Le LSI ajoute une couche supplémentaire d'algèbre linéaire pour trouver des relations entre mots au-delà de la simple fréquence. Aucune des deux, telle quelle, n'est le mécanisme de classement d'un moteur de recherche moderne.

Faut-il répéter le mot-clé principal plusieurs fois si on n'utilise pas de mots-clés LSI ?

Non plus. Utilisez le mot-clé principal et ses variantes naturelles là où la phrase l'appelle réellement, dans le titre, l'introduction, un ou deux intertitres, sans le forcer à intervalles réguliers. La répétition mécanique est tout aussi artificielle qu'une liste de synonymes forcés ; les deux trahissent un texte écrit pour un algorithme plutôt que pour un lecteur.

Comment savoir si mon article couvre suffisamment le sujet ?

Comparez-le honnêtement aux pages déjà bien classées en première page : répond-il aux mêmes sous-questions, avec au moins autant de précision ? Si un concurrent traite un aspect du sujet que vous avez ignoré, c'est le signal à suivre, pas un pourcentage de « densité sémantique » à atteindre.

Tous les articles