llms.txt: Das robots.txt des KI-Zeitalters
Dreißig Jahre nach robots.txt entsteht eine neue Datei nach derselben Logik: llms.txt. Wozu sie dient, wie man sie schreibt, und warum ihre Übereinstimmung mit robots.txt entscheidend ist.
1994 begannen Website-Betreiber, eine robots.txt-Datei im Root-Verzeichnis ihrer Domain zu platzieren. Sie teilte Web-Crawlern mit, was zu indexieren und was zu ignorieren war. Niemand hat sie dazu gezwungen. Sie wurde zu einem universellen Standard, weil sie ein reales Bedürfnis erfüllte: Bots die nötigen Anweisungen zu geben, um ihre Arbeit korrekt zu erledigen.
Dreißig Jahre später entsteht eine neue Datei nach derselben Logik: llms.txt.
Ihre Aufgabe? Sprachmodellen die wesentlichen Informationen über Ihre Website zu liefern, so strukturiert, dass sie diese effizient verarbeiten können — ohne selbst herleiten zu müssen, was wichtig ist.
Was llms.txt macht
Die Datei llms.txt liegt im Root-Verzeichnis einer Domain, genau wie robots.txt. Sie enthält eine strukturierte Beschreibung der Website — in Markdown, lesbar für LLMs — mit den zentralen Informationen zur Entität, ihren Produkten, ihren Werten, ihren vertrauenswürdigen Quellen und ihren strategischen Seiten.
Konkret kann sie enthalten:
- Was das Unternehmen tut, in einem präzisen Satz
- Die wichtigsten Produkte oder Dienstleistungen und ihre Merkmale
- Die Zielgruppe
- Die wichtigsten Seiten, die man kennen sollte
- Autoren oder Experten, die mit der Website verbunden sind
- Links zu Quellen, die über die Website berichten (Presse, Studien, Vergleiche)
Das Prinzip: Statt ein LLM aus verstreuten Fragmenten ein unvollständiges oder verzerrtes Bild Ihrer Marke rekonstruieren zu lassen, geben Sie ihm eine strukturierte, überprüfbare, kohärente Informationsbasis an die Hand.
Warum es für GEO wichtig ist
LLMs kennen eine Marke auf zwei Wegen.
Der erste ist das Training. Alles, was vor dem Wissenscutoff des Modells aufgenommen wurde. Dort leben bekannte Marken, etablierte Fakten, Informationen, die in vielen Quellen wiederholt werden. Bei jungen, nischigen oder online schlecht repräsentierten Marken ist diese Ebene lückenhaft oder ungenau.
Der zweite Weg ist die Echtzeitsuche. Wenn das Modell Zugriff auf Suchwerkzeuge hat, sucht es nach aktuellen Informationen. Und was es zuerst findet, sind die am besten strukturierten, am leichtesten auswertbaren Quellen.
llms.txt wirkt auf beiden Ebenen. Sie verbessert die Qualität der Informationen, die dem Modell in Echtzeit zur Verfügung stehen, und strukturiert diese Informationen so, dass die Wahrscheinlichkeit maximiert wird, dass das Modell sie in seinen Antworten verwendet.
Was eine schlecht geschriebene llms.txt (nicht) bewirkt
Eine leere oder generische llms.txt ist eine vertane Chance. Eine automatisch generierte llms.txt ohne Kalibrierung ist manchmal noch schlimmer — sie kann vage Beschreibungen enthalten, die ein ungenaues Bild verstärken.
Die häufigsten Fehler:
Zu vage Beschreibung. "Innovatives Unternehmen im digitalen Sektor" sagt einem LLM nichts. "GEO-Plattform, die Markenzitate in ChatGPT, Gemini und Perplexity verfolgt und Content-Maßnahmen auf Basis von Fan-out Queries empfiehlt" sagt viel.
Fehlende benannte Entitäten. LLMs arbeiten mit Entitäten — Namen, Produkten, Technologien, Orten, Personen. Eine llms.txt ohne klare Entitäten ist kaum nutzbar.
Vergessene Drittquellen. Der Verweis auf Presseartikel, Vergleiche und Studien, die Ihre Marke erwähnen, stärkt die Glaubwürdigkeit der Information in den Augen des Modells.
Fehlende Übereinstimmung mit dem restlichen Website-Inhalt. Sagt die llms.txt eine Sache und die Seiten der Website eine andere, entscheidet das Modell anhand der stärkeren Signale — nicht unbedingt zu Ihren Gunsten.
Widersprüchliche robots.txt. KI-Crawler in robots.txt zu blockieren und gleichzeitig eine llms.txt zu pflegen, ist widersprüchlich. Beide Dateien müssen aufeinander abgestimmt sein.
llms.txt und robots.txt: Übereinstimmung als Voraussetzung
Die llms.txt funktioniert nicht isoliert. Sie steht im Zusammenhang mit robots.txt, mit strukturierten Schema.org-Daten, mit der allgemeinen Qualität des Website-Inhalts.
Die Übereinstimmung zwischen robots.txt und llms.txt wird oft vernachlässigt. Manche Websites blockieren KI-Crawler in robots.txt aus einem Datenschutzreflex heraus, ohne zu bemerken, dass dies die Wirkung der llms.txt vollständig neutralisiert. Andere erlauben das Crawling, haben aber eine llms.txt, die ihren Produktseiten widerspricht.
Vurto enthält ein Modul, das beide Dateien gemeinsam prüft und neu schreibt — robots.txt und llms.txt —, um sicherzustellen, dass die den Modellen gegebenen Anweisungen kohärent, vollständig und mit der übergeordneten GEO-Strategie abgestimmt sind. Das ist einer der Ausgangspunkte jedes ernsthaften GEO-Audits.
Wie man eine wirksame llms.txt schreibt
Die empfohlene Struktur ist einfach:
# [Firmenname]
[Präzise Beschreibung in 2-3 Sätzen: was Sie tun, für wen, mit welchem Unterschied]
## Produkte / Dienstleistungen
- [Produkt 1]: [funktionale Beschreibung in einem Satz]
- [Produkt 2]: [funktionale Beschreibung in einem Satz]
## Zielgruppe
[Beschreibung der Hauptzielgruppe: Branche, Größe, Rolle, gelöstes Problem]
## Wichtige Seiten
- [URL Seite 1]: [was man dort findet]
- [URL Seite 2]: [was man dort findet]
## Referenzquellen
- [Link Presseartikel]
- [Link Vergleich]
- [Link Studie, die die Marke zitiert]
Das ist kein in Stein gemeißeltes Format — der Standard entwickelt sich schnell weiter. Aber die zugrunde liegende Logik ist stabil: präzise Informationen, benannte Entitäten, Links zu Drittquellen, Übereinstimmung mit dem Rest der Website.
Der Stand des Markts 2026
Die Verbreitung von llms.txt nimmt zu. Unter den GEO-fortschrittlichsten Websites ist sie zu einem Grundreflex geworden, genau wie robots.txt oder die Sitemap.
Für Marken, die noch keine haben, ist es eine der GEO-Maßnahmen mit dem besten Aufwand-Wirkungs-Verhältnis. Ein paar Stunden Arbeit, eine gut geschriebene Datei, eine geprüfte Übereinstimmung mit robots.txt — und Sie geben LLMs eine verlässliche Informationsbasis über Ihre Marke, die sie vorher nicht hatten.
In einer Welt, in der generative Engines ihre Antworten aus den verfügbaren Signalen aufbauen, ist die Kontrolle dieser Signale an der Quelle eine elementare Form digitaler Hygiene.
Vurto prüft und schreibt die Dateien llms.txt und robots.txt neu, um ihre Übereinstimmung sicherzustellen und die Lesbarkeit Ihrer Website für LLMs zu maximieren.