Robots.txt prüfen & validieren
Kurze Antwort
Prüfen Sie Ihre robots.txt: die Regeln, die Sitemap-Zeile, ob eine Seite gecrawlt werden darf und welche KI-Crawler sie lesen dürfen.
Was es nicht leistet: Es liest die Regeln, wie sie geschrieben sind, und kann nicht sagen, ob ein Crawler sie befolgt; manche KI-Abrufer, die im Auftrag eines Nutzers handeln, ignorieren robots.txt womöglich, und eine Crawl-Sperre entfernt keine Seite aus den Suchergebnissen.
Was es macht
Ruft Ihre `/robots.txt` ab und parst jede Direktive – User-agent-Gruppen, Allow-/Disallow-Regeln, Sitemap und Crawl-delay. Prüft, ob die von Ihnen eingegebene URL erlaubt ist, unter Verwendung derselben Longest-Match-Priorität, die echte Crawler nutzen, und markiert ein pauschales `Disallow: /`, eine fehlende Sitemap-Direktive und eine übergroße Datei. Außerdem listet es die wichtigsten KI-Crawler und Steuerungs-Token auf, zeigt, ob jeder diese URL abrufen darf, und erklärt, wofür jeder gedacht ist: KI-Modelltraining, KI-Suchantworten oder das Öffnen einer Seite, wenn ein:e Nutzer:in danach fragt.
Warum es wichtig ist
Ein einziges versehentliches `Disallow: /` kann Suchmaschinen davon abhalten, eine ganze Website zu crawlen, und es passiert leicht aus Versehen aus einem Staging-Setup heraus. KI-Crawler werfen eine zweite Frage auf: Einen Trainings-Crawler zu blockieren, entfernt Sie nicht aus KI-Suchantworten, aber einen Such-Crawler zu blockieren kann das – es lohnt sich also zu wissen, welches Token was tut.
Wie es funktioniert
-
Die zu testende URL eingeben
-
Wir rufen `/robots.txt` ab und parsen jede Direktive
-
Prüfen, ob diese URL für Crawler im Allgemeinen und für jeden KI-Crawler erlaubt ist, unter Verwendung der Prioritätsregeln, die echte Crawler nutzen
-
Eine vollständige Website-Sperre, eine blockierte URL und eine fehlende Sitemap-Direktive markieren und jeden KI-Crawler erklären
Beispiel-Ein- und Ausgabe
url: https://rankproof.eu/tools
https://rankproof.eu/robots.txt: 200 OK Dateigröße: 412 B · User-Agent-Gruppen: 2 · Crawl-delay: nicht gesetzt diese Seite ist crawlbar OK Sitemap-Direktive vorhanden OK KI-Crawler — alle dürfen diese Seite lesen: GPTBot Allowed OpenAI: sammelt Seiten, um KI-Modelle zu trainieren. OAI-SearchBot Allowed OpenAI: indexiert Seiten, damit seine KI-Suche sie zeigen und zitieren kann. ChatGPT-User Allowed OpenAI: öffnet eine Seite, wenn ein:e Nutzer:in den Assistenten danach fragt. Google-Extended Allowed Google: kein eigener Crawler — eine Regel für die KI-Nutzung gecrawlter Seiten. …
Wer es nutzt
-
Technical SEO
Vor dem Launch die Produktions-robots.txt prüfen, damit eine "alles sperren"-Regel aus dem Staging nie live geht.
-
Website-Betreiber:in
Entscheiden, welche KI-Crawler erlaubt werden: KI-Suche-Crawler offen halten und gleichzeitig wählen, ob Ihre Seiten KI-Modelle trainieren dürfen.
-
Content-Manager:in
Wenn ein Bereich aus der Google Search Console verschwindet, zuerst prüfen, ob robots.txt ihn blockiert.
Häufig gestellte Fragen
- Was ist robots.txt?
- Eine reine Textdatei an Ihrer Domain-Root, die Crawlern sagt, welche URLs sie anfordern dürfen und welche nicht. Sie ist in RFC 9309 (2022) standardisiert.
- Kann ich KI-Crawler separat blockieren?
- Ja – jeder hat sein eigenes User-Agent-Token, etwa `GPTBot` oder `ClaudeBot`. Mehrere KI-Unternehmen betreiben getrennte Crawler für Modelltraining und für die Suche, sodass Sie das Training blockieren und trotzdem in deren KI-Suchantworten sichtbar bleiben können.
- Was ist Google-Extended?
- Ein Steuerungs-Token, kein eigener Crawler. Google crawlt so oder so mit seinen üblichen Crawlern; ein Disallow für `Google-Extended` sagt Google, Ihre Inhalte nicht für das Training von Gemini-Modellen oder zur Fundierung von Antworten in Gemini-Apps zu nutzen. Es hat keinen Einfluss auf die Google-Suche oder das Ranking.
- Halten sich alle KI-Crawler an robots.txt?
- Die großen KI-Unternehmen sagen, dass ihre Crawler das tun. Manche Abrufer, die auf Nutzeranfrage handeln, etwa ChatGPT-User und Perplexity-User, wenden robots.txt-Regeln möglicherweise nicht an, und der Bericht markiert diese.
- Was ist der Unterschied zwischen robots.txt und noindex?
- robots.txt verhindert das Crawlen. `noindex` erlaubt das Crawlen, verhindert aber die Indexierung. Sperren Sie eine Seite in robots.txt, kann Google ihr noindex-Tag nicht sehen – ein häufiger Fehler.
- Sollte ich eine Sitemap-Direktive einfügen?
- Ja – `Sitemap: https://example.com/sitemap.xml` hilft jedem Crawler, Ihre Sitemap zu finden, einschließlich Bing und anderer Suchmaschinen.
- Respektiert Google robots.txt immer?
- Fürs Crawlen ja. Aber eine blockierte URL kann trotzdem in den Suchergebnissen erscheinen, wenn andere Seiten darauf verlinken – ohne Snippet. Nutzen Sie noindex, um eine Seite ganz herauszuhalten.