Praktischer Leitfaden

robots.txt für Googlebot und AI-Crawler testen

Eine robots.txt-Regel wirkt nur für den passenden Crawler und Pfad. Ein robots.txt Test muss deshalb beides exakt benennen – nicht nur nach einem Wort in der Datei suchen.

Googlebot und AI-Crawler getrennt testen

robots.txt gruppiert Regeln nach User-agent-Produkt-Token. Googlebot steht für Google Search. OAI-SearchBot betrifft die ChatGPT-Suche, GPTBot mögliches OpenAI-Training. Auch Claude veröffentlicht getrennte Tokens für Suche, Training und nutzerveranlasste Abrufe. Ein allgemeines Label wie AI-Bot reicht deshalb nicht für einen belastbaren Test.

Ein User-Agent-String im Log ist nur eine Behauptung. robots.txt steuert Zugriff; sie authentifiziert den Request nicht.

Die spezifischste passende Regel entscheidet

Nach RFC 9309 werden passende Gruppen und Pfadmuster ausgewertet. Die längste passende Regel gewinnt; bei gleicher Länge erhält Allow Vorrang. Ein Stern kann Zeichenfolgen abdecken, ein Dollarzeichen das Pfadende markieren.

  • Teste mit dem exakten Pfad einschließlich relevanter Query.
  • Prüfe wiederholte Gruppen desselben Tokens gemeinsam.
  • Wenn keine exakte Gruppe existiert, kann die Stern-Gruppe gelten.
  • robots.txt selbst ist implizit erreichbar.

Allow und Disallow an einer konkreten URL prüfen

Ein robots.txt Tester braucht immer zwei Eingaben: den Crawler-Token und den Zielpfad. Eine Regel für /intern/ sagt ohne den konkreten Pfad noch nicht, ob /intern/vorschau.html erlaubt oder blockiert ist.

Teste nicht nur die Startseite. Nimm genau die URL, deren Abruf du erklären möchtest, und dokumentiere die gewinnende Regel. So bleibt das Ergebnis reproduzierbar, wenn später weitere Gruppen oder Ausnahmen hinzukommen.

Crawling ist nicht Indexierung

Eine Disallow-Regel verhindert in erster Linie den Abruf. Sie ist kein verlässlicher Weg, eine bekannte URL aus Suchergebnissen zu entfernen. Ein noindex muss vom Crawler gelesen werden können; blockierst du den Abruf, kann genau das scheitern.

Prüfe zusätzlich HTTP-Status, Content-Type, Meta-Robots, X-Robots-Tag und Firewall-Verhalten. Eine Allow-Entscheidung garantiert keinen Besuch.

Für vertrauliche Inhalte brauchst du Authentifizierung. robots.txt ist öffentlich und keine Zugriffskontrolle.

Direkt ausprobieren

Wähle Googlebot, ChatGPT oder Claude und prüfe eine öffentliche URL oder bereits kopierte Regeln.

robots.txt für einen Crawler testen

Primärquellen

Zuletzt geprüft am 31. August 2026.