Wenn du den Unterschied zwischen robots.txt und Meta-Robots verstehen willst, reicht eine klare Trennung: robots.txt steuert das Crawling, Meta-Robots und der X-Robots-Tag steuern die Indexierung und teils die Darstellung in der Suchmaschine, und llms.txt ist höchstens eine freiwillige Hilfe für KI-Discovery. Genau diese drei Ebenen werden in KMU-Projekten oft vermischt. Das Ergebnis sind Seiten, die blockiert sind, aber trotzdem auftauchen, oder Seiten mit noindex, die Google nie lesen kann.
Ich sehe das seit Jahren in Website-Relaunches, Shop-Systemen und mehrsprachigen Unternehmensseiten: Die Technik ist oft nicht das eigentliche Problem. Das Problem ist, dass ein Signal für Zugänglichkeit, ein anderes für Sichtbarkeit und ein drittes für KI-Orientierung gehalten wird. Wenn du das sauber trennst, vermeidest du typische SEO-Fehler, unnötige Unklarheit im Index und viel Zeit in der Fehlersuche.
Merksatz: robots.txt sagt einer Suchmaschine, was sie crawlen darf. Meta-Robots sagt einer Suchmaschine, was mit einer konkreten URL im Index passieren soll. llms.txt beschreibt freiwillig Inhalte für KI-Systeme, ist aber kein verbindlicher Zugriffsschutz.
robots.txt und Meta-Robots: Was ist der Unterschied?
Der Vergleich zwischen robots.txt und Meta-Robots ist Grundlagenarbeit. Beide Signale greifen an unterschiedlichen Stellen, haben unterschiedliche Reichweite und lösen unterschiedliche Aufgaben.
robots.txt: Zweck, Ort, Wirkung, Grenzen
- Zweck: robots.txt steuert das Crawling. Du gibst Bots Hinweise, welche Bereiche sie abrufen sollen oder nicht.
- Ort der Implementierung: Die Datei liegt im Root einer Domain. Sie arbeitet mit Angaben wie User-agent und Disallow.
- Wirkung: Die Datei kann Zugriffe auf Verzeichnisse, Dateitypen oder URL-Muster für bestimmte Crawler einschränken.
- Grenzen: robots.txt ist kein verlässliches Mittel, um eine URL aus dem Google-Index zu entfernen. Eine blockierte URL kann trotzdem bekannt bleiben und in Suchergebnissen erscheinen.
Meta-Robots und X-Robots-Tag: Zweck, Ort, Wirkung, Grenzen
- Zweck: Meta-Robots steuert vor allem die Indexierung einzelner Seiten. Typische Angaben sind noindex oder nofollow.
- Ort der Implementierung: Das Meta-Robots-Tag sitzt im HTML-Head einer konkreten Seite. Der X-Robots-Tag wird dagegen im HTTP-Header gesetzt und ist deshalb auch für PDFs, Bilder oder andere nicht HTML-Dateien praktisch.
- Wirkung: Damit sagst du einer Suchmaschine, ob eine URL indexiert werden soll und wie mit Signalen dieser URL umzugehen ist.
- Grenzen: Die Suchmaschine muss die Ressource abrufen können, um den Meta-Robots-Tag oder X-Robots-Tag überhaupt zu sehen.
llms.txt: Zweck, Ort, Wirkung, Grenzen
- Zweck: llms.txt soll KI-Systemen eine kuratierte Orientierung über wichtige Inhalte einer Website geben.
- Ort der Implementierung: Meist im Root der Domain als eigenständige Datei.
- Wirkung: llms.txt kann die KI-Discovery unterstützen, also das Auffinden und Einordnen relevanter Inhalte für LLM-basierte Systeme.
- Grenzen: llms.txt ist kein anerkannter Webstandard, kein Ersatz für robots.txt und kein belastbarer Mechanismus für Zugriffskontrolle oder Indexierungssteuerung.
Die wichtigsten Fehlannahmen kurz aufgelöst
1. Eine per robots.txt blockierte URL ist nicht automatisch aus Google entfernt
Das ist einer der häufigsten Denkfehler. Google dokumentiert ausdrücklich, dass eine URL trotz robots.txt-Blockade in den Suchergebnissen erscheinen kann, wenn Google die URL über andere Signale kennt, zum Beispiel über interne oder externe Links: Quelle: Google Search Central. robots.txt verhindert also das Crawling der Inhalte, aber nicht zwingend die Kenntnis der URL.
2. noindex funktioniert nur, wenn Google die Seite lesen darf
Auch das wird oft falsch umgesetzt. Laut Google muss Googlebot eine Seite crawlen können, um ein Meta-Robots-Tag mit noindex oder einen X-Robots-Tag überhaupt zu sehen; ist die URL per robots.txt blockiert, wird diese Regel nicht ausgelesen und damit ignoriert: Quelle: Google Search Central. Kurz gesagt: Disallow plus noindex ist in vielen Fällen eine schlechte Kombination, wenn du eine URL wirklich aus dem Index bekommen willst.
3. llms.txt ist kein Ersatz für robots.txt
Bei llms.txt gibt es aktuell viel Aufmerksamkeit, aber die Einordnung sollte sauber bleiben. Die Spezifikation wird von Jeremy Howard beziehungsweise Answer.AI selbst als Proposal und informelle Spezifikation mit Community-Input beschrieben, nicht als offiziell anerkannter Webstandard: Quelle: GitHub. Deshalb ist llms.txt eher eine freiwillige Orientierung für KI-Systeme als ein technisches Steuerungsinstrument.
Wenn du X willst, nutze Y
- Du willst Crawling in bestimmten Bereichen begrenzen: Nutze robots.txt mit sauber definiertem User-agent und Disallow.
- Du willst eine konkrete Seite nicht im Google-Index haben: Nutze Meta-Robots mit noindex oder einen X-Robots-Tag und erlaube das Crawling, bis Google das Signal verarbeitet hat.
- Du willst PDFs oder andere Dateien steuern, die keinen HTML-Head haben: Nutze den X-Robots-Tag.
- Du willst KI-Systemen Orientierung über wichtige Inhalte geben: Nutze llms.txt als freiwillige Ergänzung, nicht als Zugriffsschutz.
- Du willst sensible Inhalte wirklich schützen: Setze auf Authentifizierung, Rechteverwaltung oder entferne die Inhalte ganz. Weder robots.txt noch llms.txt sind dafür gedacht.
Typische Fehlkonfigurationen bei KMU-Websites
Gerade bei inhabergeführten Betrieben und kleinen Teams sehe ich in Audits immer wieder dieselben Muster. Meist entstehen sie nicht aus Nachlässigkeit, sondern aus Zeitdruck, Plugin-Standardeinstellungen oder einem Relaunch ohne klare technische Verantwortung. Genau deshalb prüfen wir in unserer Webdesign-&-Entwicklung nicht nur Layout und Inhalte, sondern auch die Signallogik für SEO, Indexierung und maschinenlesbare Zugänglichkeit.
- noindex und Disallow gleichzeitig: Die Seite soll verschwinden, wird aber gleichzeitig für Googlebot gesperrt. Dann kann Google das noindex-Signal oft nicht lesen.
- Staging- oder Testseiten nur per robots.txt sperren: Das ist kein echter Schutz. Für Vorschau- oder Kundenbereiche ist Passwortschutz deutlich sauberer.
- Globale nofollow-Einstellungen ohne Strategie: Das wird manchmal aus Unsicherheit aktiviert, ohne dass klar ist, welche internen Signale damit geschwächt werden.
- llms.txt als vermeintliche Kontrolle über KI-Zugriffe: Eine llms.txt kann Orientierung bieten, aber sie ist kein verbindlicher Mechanismus, um Bots technisch auszusperren.
- Plugin-Konfiguration ohne Gesamtbild: Eine Suchmaschine bewertet nicht nur ein einzelnes Tag, sondern das Zusammenspiel aus Crawling, Statuscodes, interner Verlinkung, Canonicals und Indexsignalen.
Praxislogik für KMU: Weniger Dateien, mehr Klarheit
Meine Empfehlung ist fast immer dieselbe: Nutze jede Datei nur für das, wofür sie gebaut wurde. Eine gute Website braucht keine technische Übersteuerung, sondern klare Zuständigkeiten. robots.txt für Crawl-Regeln, Meta-Robots oder X-Robots-Tag für Indexierungsregeln, llms.txt für freiwillige KI-Orientierung.
Wenn du tiefer in das Zusammenspiel aus SEO, GEO und maschinenlesbarer Sichtbarkeit einsteigen willst, findest du in unserem Beitrag zur KI-Sichtbarkeit für KMU die strategische Einordnung. Und wenn du dir bei deiner bestehenden Website unsicher bist, ob die Signale technisch sauber gesetzt sind, ist eine fundierte Beratung meist günstiger als Wochen im Blindflug.
FAQ: Die häufigsten Fragen aus der Praxis
Entfernt robots.txt eine Seite aus dem Google-Index?
Nein, robots.txt steuert in erster Linie das Crawling, nicht die sichere Entfernung aus dem Index. Wenn Google die URL bereits kennt, kann die URL trotzdem erscheinen, auch ohne sichtbaren Seiteninhalt.
Soll ich noindex und Disallow zusammen verwenden?
Nur mit großer Vorsicht. Wenn Google die Seite wegen Disallow nicht crawlen darf, kann Google das noindex-Signal oft nicht auslesen. Für die Deindexierung ist ein erreichbares noindex in der Regel der sauberere Weg.
Wann ist der X-Robots-Tag sinnvoller als ein Meta-Robots-Tag?
Immer dann, wenn du keine klassische HTML-Seite steuerst, zum Beispiel bei PDFs, Bildern oder serverseitig ausgelieferten Dateien. Der X-Robots-Tag sitzt im HTTP-Header und gibt dir dort deutlich mehr Kontrolle.
Braucht jede Unternehmenswebsite schon jetzt eine llms.txt?
Nein. Für viele KMU sind eine saubere Informationsarchitektur, gutes technisches SEO und klarer Content wichtiger als eine zusätzliche Datei. Wenn du dich tiefer mit KI-orientierter Web-Architektur beschäftigen willst, ist auch unser Beitrag zu llms.txt und KI-orientierter Web-Architektur als nächste Lektüre sinnvoll.