Kann ich die Suche erlauben und das Modelltraining einschränken?
Machen Sie sich vor dem Bearbeiten von robots.txt klar, was Sie zulassen und was Sie einschränken möchten. Kopieren Sie die Liste der Bot-Namen nicht, ohne die aktuelle Dokumentation des Anbieters zu prüfen. Bezeichner und Zwecke können sich ändern.
Schritt für Schritt vorgehen
- Legen Sie fest, welche Nutzung für die Suche und andere Zwecke erlaubt sein soll.
- Prüfen Sie die aktuellen Kennungen in der offiziellen Dokumentation des jeweiligen Dienstes.
- Prüfen Sie, welche Regeln für den konkreten Pfad tatsächlich gelten.
- Berücksichtigen Sie neben robots.txt auch CDN, Firewall und Serverantwort.
- Dokumentieren Sie die Änderung und prüfen Sie anhand der Logs das Verhalten bekannter Crawler.
Praktisches Beispiel
Der Eigentümer möchte in der Suche sichtbar sein, aber bestimmte andere Nutzungen der Inhalte nicht erlauben. Unterscheiden Sie zuerst die betreffenden Crawler; ein pauschales Verbot mit User-agent: * würde auch Bereiche betreffen, die zugänglich bleiben sollen.
Häufiger Irrtum
Der User-Agent-Name lässt sich fälschen. robots.txt ist keine Sicherheitsbarriere und wird nur von kooperierenden Crawlern beachtet. Schützen Sie sensible Inhalte durch Authentifizierung.
Sehen Sie sich den Report für unsere Website an.
Sehen Sie sich ein Beispiel des Reports an und geben Sie anschließend Ihre eigene URL ein. Sie erhalten Befunde, HTML-Belege und einen Maßnahmenplan für Ihre Seite.
Eigenes Audit startenfukamo.com/sk
59/100Ihre Website braucht Korrekturen.
- Bestanden 241
- Zu überprüfen 17
- Fehlgeschlagen 7
- Nicht verfügbar 8
- Kritisch 0
- Hohe Priorität 5
- Normale Priorität 2
- Zu überprüfen 17
- 01Strukturierte DatenHohe Priorität×2
- 02SicherheitHohe Priorität
- 03LeistungssignaleHohe Priorität
- 04LeistungHohe Priorität
- Erkenntnisse7 zu beheben241 Prüfungen erfolgreich
- Maßnahmenplan24 Aufgaben7 Reparaturen · 17 Überprüfungen
- Seitendaten3.243 Wörter10 Bilder ohne alt-Text
- Leistung und Barrierefreiheit66 / 100Mobil · Lighthouse
- Links und Server282 Links23 externe Links
Wozu dienen OAI-SearchBot und GPTBot?
OpenAI dokumentiert getrennte Kontrollen für die Suche mit OAI-SearchBot und das Training mit GPTBot. Eine Regel für einen Namen beschreibt nicht die gesamte Richtlinie für beide Zwecke.
- Legen Sie fest, welche öffentlichen Inhalte für die Suche verfügbar sein sollen.
- Dokumentieren Sie Einschränkungen für das Training separat.
- Schützen Sie private Konten durch Anmeldung.
Ursprung OpenAI · Zwecke der Crawler ↗
Für welchen Anthropic-Crawler soll die Regel gelten?
Anthropic unterscheidet ClaudeBot, Claude-SearchBot und Claude-User. Hinterlegen Sie die Anbieterdokumentation bei der Richtlinie, damit künftige Verantwortliche die einzelnen Regeln nachvollziehen können.
- Ordnen Sie die Kennung einem dokumentierten Zweck zu.
- Legen Sie fest, für welchen Host und Pfad die Regel gilt.
- Notieren Sie Verantwortliche und Grund für die nächste Prüfung.
Ursprung Anthropic · Crawler ↗
Warum kann HTTP 200 einen blockierten Crawler verbergen?
Eine WAF-Abfrage kann einen erfolgreichen Status zurückgeben und dabei den Artikel ersetzen. Fehlende Überschriften beschreiben dann die Abfrage und nicht Ihre Seite.
- Prüfen Sie die endgültige URL, den Antwortinhalt und die Weiterleitungen.
- Vergleichen Sie den öffentlichen Artikel mit einem eingeschränkten Pfad.
- Prüfen Sie die Identität des Crawlers nach dem Verfahren des Anbieters.
So prüfen Sie eine Änderung des Crawler-Zugriffs
Unterscheiden Sie die Prüfung der Konfiguration von tatsächlichen Crawler-Aufrufen. Dass unmittelbar nach der Bereitstellung kein Besuch erscheint, belegt keinen Regelungsfehler.
- Rufen Sie die veröffentlichte robots.txt ab.
- Prüfen Sie eine Auswahl erlaubter und beschränkter URLs.
- Bewahren Sie den Konfigurationsverlauf und relevante Antworten aus den Protokollen auf.
So bestätigen Sie das Ergebnis
Testen Sie für einen bestimmten Crawler je einen erlaubten und einen gesperrten Pfad. Dokumentieren Sie die wirksame robots.txt-Regel und die Serverantwort. Prüfen Sie Zugriffe in den Logs nach dem Verfahren des Anbieters.
Primärdokumentation developers.openai.com ↗
Häufige Fragen
Kann ich die Suche erlauben und das Modelltraining einschränken?
Anbieter können für verschiedene Zwecke unterschiedliche Kennungen und Kontrollen verwenden. Richten Sie sich daher nach der aktuellen Dokumentation des jeweiligen Dienstes. Eine pauschale Sperre aller Crawler kann auch die gewünschte Suche ausschließen. Eine Regel für einen Anbieter gilt nicht automatisch für andere.
Wann Sie die Aufgabe schließen können
Dokumentieren Sie Zweck der Regel, Quelle der Kennung und Prüfdatum. Vergleichen Sie robots.txt mit CDN-Schutz und tatsächlichen Antworten; der angegebene Crawlername allein bestätigt nicht die Identität eines Besuchers.
Verwandte SEO-Anleitungen
Prüfen Sie eine konkrete Seite.
Fukamo zeigt Befunde, Belege und den nächsten Schritt.
836 Regeln + Messungen zu SEO, AI-Lesbarkeit, Leistung und Barrierefreiheit kostenlos.