LSI-Keywords: Der Mythos und was wirklich zählt

Wer nach "LSI-Keywords" sucht, landet fast immer bei einem Tool, das eine Liste angeblich "semantisch verwandter" Begriffe ausspuckt – mit dem Versprechen, dass ihr Einbau ins Ranking hilft. Das Problem: Latent Semantic Indexing hat mit dem, was diese Tools tun, praktisch nichts zu tun. LSI ist eine echte, jahrzehntealte Technik aus der Informationswissenschaft – nur eben nicht die, die die SEO-Branche daraus gemacht hat.
Dieser Artikel klärt zuerst, was LSI ursprünglich war und wofür es gebaut wurde, dann, wie daraus ein SEO-Mythos wurde, und schließlich, was moderne Suchmaschinen stattdessen tatsächlich auswerten. Am Ende steht die praktische Frage, die dich hierhergeführt hat: Welche Begriffe gehören wirklich in deinen Text – und wie findest du sie, ohne ein "LSI-Tool" zu bemühen?
Was Latent Semantic Indexing wirklich war
Latent Semantic Indexing (auch Latent Semantic Analysis, LSA) entstand Ende der 1980er-Jahre als Antwort auf ein sehr konkretes Problem im Information Retrieval: Nutzer suchen in einer Dokumentensammlung oft mit anderen Wörtern, als in den relevanten Dokumenten stehen. Ein Dokument über "Automobil" wird bei einer Suche nach "Wagen" nicht gefunden, wenn das Suchsystem nur exakte Wortübereinstimmungen zählt. Dieses Problem heißt Vokabular-Mismatch, und LSI wurde entwickelt, um es mathematisch zu lösen.
Die Technik baut eine große Matrix aus Begriffen und Dokumenten und reduziert sie mit einem Verfahren aus der linearen Algebra namens Singulärwertzerlegung auf eine kleinere Anzahl "latenter" Dimensionen. Diese Dimensionen bilden keine Themen im menschlichen Sinn ab, sondern statistische Muster: Begriffe, die häufig in denselben Dokumenten auftauchen, rücken im reduzierten Raum näher zusammen. Das erlaubte es, Dokumente zu finden, die thematisch passten, auch wenn kein einziges Suchwort wörtlich vorkam.
Entscheidend ist der Kontext, für den LSI gebaut wurde: geschlossene, überschaubare Dokumentsammlungen – etwa Bibliothekskataloge, Patentdatenbanken oder wissenschaftliche Archive mit Zehntausenden, nicht Milliarden von Dokumenten. Die Matrix musste komplett neu berechnet werden, sobald sich die Sammlung änderte, was das Verfahren rechenintensiv und für ein sich ständig veränderndes, weltweites Web praktisch ungeeignet machte.
Historisch wurde LSI vor allem in sehr begrenzten, kuratierten Umgebungen eingesetzt: in Bibliothekskatalogen, um verwandte Werke trotz unterschiedlicher Terminologie zu finden, oder in Patentdatenbanken, um ähnliche Erfindungen aufzuspüren, selbst wenn verschiedene Anmelder unterschiedliche Fachbegriffe für dieselbe Sache verwendeten. In all diesen Fällen kannte das System die komplette Dokumentensammlung im Voraus und musste sie nicht laufend um neue, unbekannte Seiten erweitern, wie es eine Websuchmaschine in jeder Sekunde tun muss.
Wie aus einer Retrieval-Technik ein SEO-Mythos wurde
Als LSI in den 2000er-Jahren in SEO-Kreisen bekannter wurde, entstand daraus eine Vermutung: Wenn eine akademische Technik Textbedeutung über bloße Wortübereinstimmung hinaus erfassen kann, benutzt Google sie vielleicht auch, um Keyword-Stuffing zu erkennen und "echte" thematische Relevanz zu belohnen. Diese Vermutung klang plausibel, war aber nie belegt – und aus einer plausiblen Vermutung wurde in Blogartikeln, Foren und Kursen schnell eine Tatsachenbehauptung.
Aus der Tatsachenbehauptung wurde ein Produkt. "LSI-Keyword-Generatoren" versprechen, dir die Begriffe zu liefern, die Google angeblich als semantisch verwandt erkennt. Was diese Tools tatsächlich tun, hat mit Singulärwertzerlegung oder einer latenten Dimensionsreduktion nichts zu tun: Sie sammeln Begriffe, die häufig gemeinsam mit deinem Suchbegriff vorkommen – aus verwandten Suchanfragen, aus Nachschlagewerken oder aus den Top-Ergebnissen selbst. Das kann nützlich sein, ist aber schlicht Ko-Okkurrenz-Analyse mit einem Label, das wissenschaftlicher klingt, als es ist.
Google-Vertreter haben wiederholt öffentlich klargestellt, dass es kein Ranking-Signal namens "LSI-Keywords" gibt und dass die Suchmaschine keine Latent-Semantic-Indexing-Technik in diesem Sinn einsetzt. Trotzdem hält sich der Begriff hartnäckig, weil er eine einfache, verkaufbare Geschichte erzählt: eine Liste von Wörtern, die du einfügst, und ein Algorithmus, der das belohnt. Diese Geschichte ist bequemer als die tatsächliche Antwort, die sich eben nicht in ein Checklisten-Produkt packen lässt.
Ein technischer Punkt erklärt zusätzlich, warum die meisten "LSI-Keyword-Tools" ihren Namen zu Unrecht tragen: Singulärwertzerlegung findet auch Beziehungen zwischen Begriffen, die niemals gemeinsam im selben Dokument auftauchen, aber beide stark mit einem dritten, gemeinsamen Begriff korrelieren – eine Beziehung höherer Ordnung. Reine Ko-Okkurrenz-Analyse, wie sie die meisten SEO-Tools durchführen, erfasst dagegen nur, welche Wörter direkt gemeinsam auftauchen – eine Beziehung nullter Ordnung, statistisch ein deutlich einfacheres Verfahren als das, was der Name "LSI" eigentlich beschreibt. Die Tools liefern trotzdem oft brauchbare Begriffslisten, aber aus einem anderen Grund, als ihr Name suggeriert: nicht wegen latenter Semantik, sondern weil Wörter, die häufig zusammen vorkommen, in der Praxis meistens auch thematisch zusammengehören.
- Der Begriff "LSI" taucht nur im Toolnamen oder Marketingtext auf, nie in einer nachvollziehbaren Erklärung der zugrunde liegenden Methode.
- Die ausgegebene Wortliste ändert sich, sobald du minimal andere verwandte Suchanfragen abfragst – ein Zeichen für simple Ko-Okkurrenz, nicht für latente Dimensionsreduktion.
- Das Tool verspricht eine Ranking-Verbesserung allein durch das Einfügen der Liste, unabhängig davon, wie gründlich der restliche Text das Thema behandelt.
Was Suchmaschinen heute tatsächlich auswerten
Moderne Suchmaschinen verstehen Sprache nicht über eine einzelne benannte Technik, sondern über das Zusammenspiel mehrerer Systeme. Ein Teil davon ist Entitätenerkennung: Die Suchmaschine erkennt, dass eine Anfrage sich auf eine bestimmte Person, einen Ort, ein Produkt oder ein Konzept bezieht, und verknüpft das mit einer Wissensbasis. Ein anderer Teil sind neuronale Sprachmodelle, die Bedeutung aus dem Kontext eines Satzes ableiten, statt Wörter isoliert zu zählen – sie erkennen, dass "Bank" in "ich sitze auf der Bank" etwas anderes meint als in "ich gehe zur Bank".
Für die Bewertung einer Seite bedeutet das: Es geht um Query-Interpretation und thematische Vollständigkeit, nicht um eine Wortliste, die abgehakt wird. Eine Seite, die ein Thema wirklich gründlich behandelt, verwendet automatisch die Begriffe, Synonyme und verwandten Konzepte, die zu diesem Thema gehören – nicht weil ein Algorithmus sie dafür belohnt, sondern weil man ein Thema ohne diese Begriffe gar nicht vollständig erklären kann.
Genau hier liegt die Verwechslung, die den Mythos am Leben hält: Wenn Analysetools zeigen, dass gut rankende Seiten bestimmte Begriffe gemeinsam haben, ist das eine Korrelation, kein Kausalmechanismus. Die Begriffe stehen dort, weil ein kompetenter Autor sie braucht, um die Frage vollständig zu beantworten – ihre Präsenz ist ein Nebenprodukt gründlicher Inhalte, kein separates Eingabefeld, das ein Ranking-Algorithmus abfragt. Fügst du dieselben Begriffe in einen dünnen, oberflächlichen Text ein, verbessert sich nichts, weil die Ursache – gründliches Themenverständnis – weiterhin fehlt.
Ein einfaches Gedankenexperiment macht den Unterschied greifbar: Zwei Texte zum selben Thema können exakt dieselben zwanzig Fachbegriffe enthalten, und trotzdem unterschiedlich gut abschneiden, weil der eine die Begriffe in einem klaren, vollständigen Zusammenhang erklärt und der andere sie nur aneinanderreiht. Für ein System, das Kontext und Zusammenhang auswertet, ist der Unterschied zwischen den beiden Texten groß – für eine reine Wortlisten-Prüfung wäre er unsichtbar. Genau diese Lücke ist es, die eine Begriffscheckliste niemals schließen kann.
Semantisches SEO ist nicht dasselbe wie LSI
Ein verwandtes Missverständnis verwechselt "LSI-Keywords" mit dem viel weiter gefassten Begriff "semantisches SEO". Semantisches SEO ist kein einzelnes Verfahren, sondern eine informelle Sammelbezeichnung für die Praxis, Inhalte anhand von Themen, Nutzerabsicht und Entitäten zu strukturieren, statt sich auf einzelne Keyword-Varianten zu konzentrieren. Es beschreibt eine Denkweise, keinen Algorithmus, und schon gar nicht die konkrete Mathematik der Singulärwertzerlegung, aus der LSI besteht.
Die Verwandtschaft, die tatsächlich existiert, liegt woanders: Moderne Wort-Einbettungen (Embeddings), wie sie heutige Sprachmodelle verwenden, gehören zur selben größeren Familie distributioneller Semantik wie LSI – beide gehen von der Grundidee aus, dass Wörter, die in ähnlichen Kontexten auftauchen, tendenziell ähnliche Bedeutung haben. Die konkreten Verfahren dahinter unterscheiden sich aber fundamental in Größenordnung, Architektur und Trainingsmethode. Diesen Unterschied zu kennen hilft, den Mythos richtig einzuordnen: Es steckt ein wahrer historischer Kern dahinter, nur eben nicht der, den dir "LSI-Keyword"-Tools verkaufen wollen.
Wann eine Checkliste sogar schadet
Der größte praktische Schaden entsteht, wenn eine generierte Wortliste als Pflichtprogramm behandelt wird. Ein Text, der jeden Begriff aus einer "LSI-Keyword"-Liste unterbringen soll, liest sich zwangsläufig unnatürlich – Sätze werden verbogen, damit ein Fachbegriff irgendwo auftaucht, der inhaltlich an dieser Stelle gar nicht hingehört. Für Leser ist das spürbar, und ein Text, der sich wie eine abgearbeitete Liste liest, erfüllt seine eigentliche Aufgabe schlechter: die Frage des Lesers klar und direkt zu beantworten.
Der zweite Schaden ist Zeitverschwendung. Jede Minute, die in das Sortieren, Priorisieren und Einbauen einer generischen Wortliste fließt, fehlt für das, was tatsächlich wirkt: die bestplatzierten Seiten wirklich zu lesen, die eigentliche Frage der Leser zu verstehen und eine Antwort zu schreiben, die vollständiger oder klarer ist als die der Konkurrenz. Die Wortliste ist bestenfalls ein Nebenprodukt dieser Arbeit – niemals ein Ersatz dafür.
Die praktische Methode: So findest du die richtigen Begriffe
Die eigentliche Frage hinter "LSI-Keywords" lautet: Welche Wörter, Konzepte und Entitäten muss mein Text abdecken, damit er das Thema wirklich vollständig behandelt? Die Antwort findest du nicht in einem generierten Wortsalat, sondern direkt in den Daten, die dir sowieso zur Verfügung stehen – ganz ohne "LSI"-Etikett.
Der eigentliche Wert dieser fünf Quellen entsteht erst im Zusammenspiel, nicht beim isolierten Abhaken jeder einzelnen. Die Top-Ergebnisse zeigen dir, was ein vollständiger Artikel zu diesem Thema mindestens leisten muss. Die verwandten Suchanfragen und die Fragen-Box zeigen dir, welche Anschlussfragen echte Leser tatsächlich haben, auch wenn keine der Top-Seiten sie beantwortet – das ist häufig die Lücke, über die du dich von der Konkurrenz abhebst. Die Autovervollständigung zeigt dir die genaue Sprache, in der Menschen wirklich suchen, nicht die Fachsprache, die du selbst vielleicht benutzt hättest. Und die Entitätenliste stellt sicher, dass du keinen Aspekt des Themas schlicht vergisst, weil er dir selbst nicht eingefallen wäre.
- Lies die aktuell bestplatzierten Seiten zu deinem Zielbegriff komplett durch und notiere, welche Unterthemen, Fragen und Fachbegriffe sie ansprechen, die du selbst noch nicht bedacht hast.
- Scrolle bis zum Ende der Suchergebnisse und sieh dir die "Ähnliche Suchanfragen" an – sie zeigen, wie Nutzer dasselbe Thema aus anderen Blickwinkeln formulieren.
- Öffne die "Nutzer fragen auch"-Box und behandle die dort aufgeführten Fragen, sofern sie zu deinem Artikel passen, direkt im Fließtext oder in einem eigenen Abschnitt.
- Tippe deinen Suchbegriff in die Suchleiste ein, ohne Enter zu drücken, und notiere die Autovervollständigungs-Vorschläge – sie spiegeln reale, häufig verwendete Formulierungen wider.
- Identifiziere die Entitäten, die das Thema unweigerlich betrifft: konkrete Produkte, Personen, Orte, Normen, Werkzeuge oder verwandte Fachbegriffe, ohne die eine vollständige Erklärung unmöglich ist.
Warum die Reihenfolge entscheidend ist
Der Unterschied zu einem generierten "LSI-Wortsalat" liegt in der Reihenfolge: Du verstehst zuerst das Thema vollständig, und die Begriffe entstehen daraus – nicht umgekehrt. Wenn du eine Liste von dreißig Wörtern bekommst und versuchst, sie alle irgendwie unterzubringen, schreibst du für einen imaginären Algorithmus. Wenn du die fünf Recherche-Schritte oben durchgehst und dann für einen Menschen schreibst, der wirklich verstehen will, landen die relevanten Begriffe von selbst im Text, weil du sie brauchst, um die Frage zu beantworten.
Ein praktischer Test danach: Lies deinen fertigen Text laut vor. Klingt ein Satz wie eine Aufzählung eingefügter Schlagwörter, ist er falsch aufgebaut – ein Begriff aus deiner Recherche muss so natürlich im Satz stehen, dass du ihn nicht als "eingebaut" erkennst. Genau das unterscheidet gründlich recherchierten Content von einer Liste, die stur abgearbeitet wurde.
Ein Beispiel: "Kaffeemaschine kaufen"
Angenommen, du schreibst einen Ratgeber zum Thema "Kaffeemaschine kaufen". Ein "LSI-Tool" würde dir vermutlich eine Liste wie "Espresso, Kapsel, Mahlwerk, Brühdruck, Milchschaum" ausspucken – Begriffe, die du dann irgendwo im Text unterbringen sollst. Gehst du stattdessen die oben beschriebenen Schritte durch, stellst du etwas anderes fest: Die bestplatzierten Seiten unterscheiden systematisch zwischen Vollautomat, Siebträger- und Kapselmaschine, weil genau das die zentrale Kaufentscheidung ist. Die "Ähnlichen Suchanfragen" zeigen, dass Nutzer parallel nach Reinigung, Entkalkung und Wasserhärte fragen. Die Fragen-Box enthält zusätzlich Fragen zu Stromverbrauch und Lautstärke.
Diese Begriffe landen in deinem Text nicht, weil eine Liste sie vorgibt, sondern weil eine ehrliche Kaufberatung sie zwangsläufig braucht – wer eine Kaffeemaschine kaufen will, muss wissen, welcher Maschinentyp zu seinem Wasserverbrauch, seinem Reinigungsaufwand und seinem Budget passt. Genau dieses Verständnis, nicht die Wortliste, ist es, was eine Suchmaschine als vollständige, relevante Antwort erkennt.
Das lässt sich auf praktisch jedes Thema übertragen, weit über Produktratgeber hinaus. Ob es um eine Anleitung, einen Vergleich oder eine Erklärung geht: Die Begriffe, die ein Thema wirklich braucht, ergeben sich aus der Frage "Was muss jemand wissen, um hier eine fundierte Entscheidung zu treffen oder ein Problem wirklich zu lösen?" – nicht aus einer Liste, die ein Tool unter dem Namen "LSI" verkauft, ohne mit der eigentlichen Technik noch etwas zu tun zu haben.
Häufige Fragen
Gibt es LSI-Keywords bei Google wirklich?
Latent Semantic Indexing ist eine echte, jahrzehntealte Technik aus der Informationswissenschaft, aber sie wurde nie für die Websuche in diesem Sinn eingesetzt. Google-Vertreter haben öffentlich klargestellt, dass es kein Ranking-Signal namens "LSI-Keywords" gibt. Der Begriff, wie ihn SEO-Tools verwenden, beschreibt in Wirklichkeit einfache Ko-Okkurrenz-Listen, keine latente Dimensionsreduktion.
Bringen "LSI-Keyword-Tools" trotzdem etwas?
Manche zeigen nützliche, thematisch verwandte Begriffe, weil sie auf echten Suchdaten oder Top-Ergebnissen basieren – das kann als Ausgangspunkt hilfreich sein. Problematisch wird es, wenn du die Liste als Pflichtcheckliste behandelst, statt das Thema selbst zu verstehen und die Begriffe organisch entstehen zu lassen.
Wie viele "LSI-Keywords" sollte ich pro Text verwenden?
Diese Frage ergibt keinen Sinn, weil es keine offizielle Kategorie "LSI-Keyword" mit einer Zielzahl gibt. Relevant ist, ob dein Text ein Thema vollständig erklärt – das lässt sich nicht durch eine Wortanzahl, sondern nur durch inhaltliche Vollständigkeit prüfen.
Was ist der Unterschied zwischen LSI-Keywords und semantischem SEO?
LSI bezeichnet eine spezifische mathematische Technik aus dem Information Retrieval der 1980er-Jahre für geschlossene Dokumentsammlungen. "Semantisches SEO" ist ein viel weiter gefasster, informeller Sammelbegriff für die Praxis, Inhalte anhand von Themen, Entitäten und Nutzerabsicht statt einzelner Keywords zu strukturieren – ohne direkten Bezug zur ursprünglichen LSI-Mathematik.