Lädt die robots.txt der Website und wertet die Crawler-Regeln für die angegebene Seite aus.
KOSTENLOSE PRÜFUNG EINER ÖFFENTLICHEN URL
robots.txt-Prüfung
Lädt die robots.txt der Website und wertet die Crawler-Regeln für die angegebene Seite aus.
VOR DER PRÜFUNG
Wissen, was Sie prüfen.
robots.txt steuert das Crawling durch Crawler, die die Regeln beachten. Für Googlebot zählen die User-agent-Gruppe und die spezifischste Pfadregel. Ein Disallow allein kann die URL in den Suchergebnissen belassen.
01
Wann Sie diese Prüfung verwenden
Möchten Sie Crawling einschränken, eine Seite aus dem Index entfernen oder private Daten schützen? Das sind drei verschiedene Aufgaben. Die folgenden Googlebot-Regeln müssen nicht dem Verhalten anderer Crawler entsprechen.
Disallow entfernt eine URL nicht zuverlässig aus der Suche und schützt keine privaten Daten. Ein Serverfehler bei robots.txt ist auch keine leere Datei, die alles erlaubt. Beheben Sie vor Pfadänderungen die Erreichbarkeit.
ROBOTS.TXT · REGELTESTER
Testen Sie Ihre robots.txt-Regeln
Fügen Sie den Dateiinhalt ein, geben Sie eine URL ein und wählen Sie einen Crawler. Fukamo zeigt die maßgebliche Regel für diesen Pfad.
Es gelten die spezifischste Crawler-Gruppe und die längste Pfadübereinstimmung; bei gleicher Übereinstimmung hat Allow Vorrang. Das Fragment # wird ignoriert. Geprüft werden weder die HTTP-Antwort noch die WAF oder tatsächliche Crawler-Besuche. Das Verhalten der Anbieter kann abweichen.
Eine Freigabe ist kein Beleg für die Indexierung. Eine Sperre entspricht nicht noindex. Dieser Tester wertet Allow und Disallow aus, validiert aber nicht die gesamte Datei. Google robots.txt ↗ · OpenAI bots ↗
Ergebnis anwenden
Testen Sie als Gegenprobe https://example.com/offers/public/bike und https://example.com/offers/draft/bike. Der öffentliche Pfad sollte erlaubt und der Entwurf blockiert sein. Berücksichtigen Sie nach der Veröffentlichung die beim Crawler zwischengespeicherte Version.
Was Sie als Nächstes prüfen sollten
Rufen Sie /robots.txt des genauen Hosts ab und prüfen Sie den Antwortstatus.
Wählen Sie die passende User-agent-Gruppe und testen Sie sowohl eine erlaubte als auch eine blockierte URL.
Prüfen Sie Groß- und Kleinschreibung sowie die Pfadspezifität. Bei gleicher Übereinstimmung bevorzugt Googlebot Allow.
Veröffentlichen Sie die Korrektur und testen Sie die ausgelieferte Datei sowie die für das Rendering benötigten Ressourcen erneut.
Ergebnis verstehen. Die richtige Änderung vornehmen.
Für welchen Crawler und Host gilt robots.txt?
Prüfen Sie robots.txt für das genaue Protokoll, den Host und den Port. Die Datei der Hauptdomain beschreibt nicht automatisch eine separate Subdomain.
Wählen Sie vor der Prüfung von Pfaden die passende User-agent-Gruppe.
Googlebot kombiniert eine spezifische Gruppe nicht mit der allgemeinen Gruppe mit Sternchen.
Halten Sie für jede geänderte Bedingung eine erlaubte und eine blockierte Test-URL fest.
So testen Sie Allow- und Disallow-Regeln
Im obigen Beispiel ist /offers/public/bike erlaubt, /offers/draft/bike dagegen blockiert. Ein ähnlich benannter Pfad außerhalb von /offers/ sollte unberührt bleiben.
Pfade unterscheiden zwischen Groß- und Kleinschreibung; testen Sie /Offers/ separat.
Ein längerer passender Pfad ist spezifischer. Bei gleicher Spezifität bevorzugt Google Allow.
Verwechseln Sie ein leeres Disallow nicht mit Disallow: /, das für die gesamte Website gilt.
Wann Sie robots.txt, noindex oder Anmeldung verwenden sollten
Disallow steuert das Crawling. Es schützt weder ein privates Dokument noch entfernt es eine bereits bekannte URL zuverlässig aus der Suche.
Ermöglichen Sie dem Crawler bei einem Ausschluss aus dem Index, die noindex-Anweisung abzurufen.
Verlangen Sie bei privaten Inhalten eine Anmeldung.
Blockieren Sie bei einer JavaScript-SEO-Prüfung keine Ressourcen, die zum Rendern der öffentlichen Seite nötig sind.
So prüfen Sie Erreichbarkeit und Größe von robots.txt
Eine korrekte CMS-Einstellung reicht nicht, wenn die öffentliche Adresse einen Fehler oder veraltete Inhalte liefert. Prüfen Sie vor der Bewertung des Crawler-Verhaltens die Antwort.
Prüfen Sie, ob eine Textdatei statt eines HTML-Login- oder Fehlerbildschirms ausgeliefert wird.
Google ignoriert Inhalte jenseits von 500 KiB; fassen Sie zu lange Regellisten zusammen.
Beheben Sie Antworten mit 5xx und 429. Eine robots.txt mit Status 404 verbietet Google nicht das Crawling.
Kann ich eine Seite mit Disallow aus Google entfernen?
Disallow beschränkt das Crawling, nicht die Anzeige der URL in Suchergebnissen. Darf der Crawler die Seite nicht abrufen, sieht er möglicherweise auch ihr noindex nicht. Erlauben Sie bei einer öffentlichen Seite, die entfernt werden soll, den Abruf und verwenden Sie eine passende Indexierungsdirektive. Schützen Sie private Inhalte durch Authentifizierung; robots.txt schützt keinen Zugriff.
Gehört robots.txt in das Verzeichnis einer bestimmten Seite?
Crawler suchen die Datei im Stammverzeichnis des jeweiligen Hosts, zum Beispiel unter /robots.txt. Regeln werden nicht automatisch zwischen Subdomains vererbt. Prüfen Sie die Datei auf dem Host, von dem die kontrollierte URL geladen wird.
Warum reicht ein robots.txt-Tester allein nicht aus?
Ein Tester bewertet die eingegebenen Regeln für einen ausgewählten User-Agent und Pfad. CDN, Firewall, Anmeldung oder Serverantwort können den Zugriff unabhängig davon beeinflussen. Vergleichen Sie das Ergebnis mit einer tatsächlichen Anfrage und Antwort der Website.
Wann Sie die Aufgabe schließen können
Prüfen Sie Regeln für den konkreten Pfad und User-Agent sowie die Antwort der nicht angemeldeten Seite. Ziel ist nicht nur eine syntaktisch gültige Datei, sondern ein tatsächlicher Zugriff, der der Absicht des Betreibers entspricht.
FUKAMO / IHRE PRIVATSPHÄRE
Ihre Website. Ihre Entscheidung.
Mit Ihrer Zustimmung speichern wir zuletzt verwendete Adressen und Auditergebnisse und messen Besuche mit Google Analytics und Google Tag Manager. Verlauf und Analyse können Sie getrennt erlauben. Wir verwenden keine Werbe-Cookies.