In Kürze: Für die meisten Websites ist Zulassen die richtige Entscheidung – wer gefunden und in KI-Antworten genannt werden will, darf die Crawler nicht aussperren. Die klare Ausnahme sind Anbieter, deren Inhalt selbst das Produkt ist: Redaktionen mit Lizenzgeschäft oder kostenpflichtige Inhalte. Entscheidend ist ein Unterschied, der ständig verwechselt wird: Training und Abruf zur Antwortzeit sind zwei verschiedene Dinge – und du kannst das eine sperren und das andere zulassen.
Diese Entscheidung hat zwei vertretbare Antworten, und genau deshalb schreibe ich sie als Abwägung, nicht als Anleitung. Die Regeln für die robots.txt stehen am Ende – zuerst geht es um die Frage davor: Willst du überhaupt gesperrt sein? Ob du umgekehrt gar nicht auftauchst, obwohl du auftauchen willst, behandelt der Beitrag dazu, warum ChatGPT nennt dich nicht.
Welche KI-Crawler greifen auf deine Website zu?
Es sind mehr als GPTBot, und sie haben unterschiedliche Aufgaben. Die wichtigste Trennung verläuft zwischen Crawlern, die Modelle trainieren, und Crawlern, die Seiten zur Antwortzeit abrufen. Diese Liste ist gegen die offiziellen Anbieter-Dokumentationen geprüft (Stand September 2026):
| User-Agent | Betreiber | Zweck |
|---|---|---|
| GPTBot | OpenAI | Training |
| OAI-SearchBot | OpenAI | Abruf für ChatGPT-Suche |
| ChatGPT-User | OpenAI | Abruf auf Nutzer-Anfrage |
| ClaudeBot | Anthropic | Training |
| Claude-SearchBot | Anthropic | Abruf für Claude-Suche |
| PerplexityBot | Perplexity | Abruf |
| Google-Extended | Training (Gemini/Grounding) | |
| CCBot | Common Crawl | offener Datensatz, meist Training |
| Bytespider | ByteDance | Training |
Sperre ich damit auch Google aus?
Nein – und das ist der häufigste Fehler. Google-Extended steuert nur, ob deine Inhalte für das Training von Gemini und für Grounding genutzt werden. Es ist nicht der Googlebot. Deine normale Google-Suche und die Google AI Overviews laufen über den Googlebot und bleiben unberührt, egal was du mit Google-Extended machst. Wer Google-Extended sperrt, verliert also keine Google-Rankings.
Was passiert, wenn du sie sperrst?
Sperrst du die Abruf-Crawler, verschwindest du aus den KI-Antworten. Blockierst du OAI-SearchBot, wirst du laut OpenAI-Dokumentation in der ChatGPT-Suche nicht mehr als Quelle geführt – dasselbe gilt für Claude-SearchBot und PerplexityBot bei den jeweiligen Systemen. Sperrst du dagegen nur die Training-Crawler, bleibt deine Sichtbarkeit in den Antworten erhalten, deine Inhalte fließen nur nicht ins Modelltraining.
Was das kostet, hat eine Untersuchung von Rutgers und Wharton (Dezember 2025) gemessen: Publisher, die KI-Crawler blockierten, verzeichneten im Schnitt 23,1 Prozent weniger Gesamt-Traffic, ohne dass sich die Zitationsrate zuverlässig verringert hätte. Sperren ist also eine bewusste Abwägung, kein sicherer Standard.
Halten sich alle Crawler an die robots.txt?
Nein. Die robots.txt ist eine Norm, keine technische Sperre – sie wirkt nur, wenn ein Bot sie liest und befolgt. Von Bytespider und einzelnen Perplexity-Crawlern ist dokumentiert, dass sie robots.txt-Regeln ignoriert haben, und ein User-Agent lässt sich fälschen. Wer wirklich aussperren muss, braucht eine Regel auf Server- oder Firewall-Ebene und prüft per Reverse-DNS, ob ein Crawler echt ist.
Verliere ich Rankings, wenn ich KI-Crawler sperre?
Klassische Google-Rankings nicht – die hängen am Googlebot, der von KI-Crawler-Regeln unberührt bleibt. Was du verlierst, ist die Sichtbarkeit in den KI-Antworten selbst, sobald du die Abruf-Crawler sperrst. Die 23,1 Prozent Traffic-Rückgang aus der genannten Untersuchung sind genau dieser Effekt, nicht ein Google-Ranking-Verlust.
Was passiert, wenn du sie zulässt?
Du wirst zitierbar – aber Zitation ist nicht gleich Klick. Meine eigene Domain lässt alle KI-Crawler zu und verzeichnet 192 Zitationen in 30 Tagen, bei gleichzeitig nur 2 Klicks über die Bing-Suche im selben Zeitraum (Stand September 2026). Das ist der ehrlichste Beleg, den ich habe: Zulassen bringt Sichtbarkeit in den Antworten, aber diese Sichtbarkeit übersetzt sich nicht automatisch in Traffic.
Für die meisten Unternehmen ist das trotzdem der richtige Weg. Genannt zu werden baut Bekanntheit auf, auch ohne sofortigen Klick – und wer gar nicht erst vorkommt, hat auch die Chance auf den Klick nicht. Das Risiko beim Zulassen ist gering, der mögliche Gewinn real.
Der Unterschied zwischen Training und Abruf zur Antwortzeit
Das ist der Kern der ganzen Entscheidung. Training-Crawler wie GPTBot, ClaudeBot oder Google-Extended sammeln Inhalte, um damit Modelle zu trainieren – der Effekt zeigt sich erst in künftigen Modellversionen. Abruf-Crawler wie OAI-SearchBot, Claude-SearchBot und PerplexityBot holen deine Seite in dem Moment, in dem ein Nutzer eine Frage stellt, und speisen sie in die aktuelle Antwort ein.
Daraus folgt die nuancierte Wahl, die viele nicht kennen: Du kannst das Training aussperren und trotzdem in den Antworten sichtbar bleiben – GPTBot sperren, OAI-SearchBot zulassen. Wer pauschal „alle KI-Bots“ blockiert, wirft beides zusammen weg, obwohl nur eines gemeint war.
Für welche Unternehmen lohnt sich welche Entscheidung?
Es gibt keine allgemein richtige Antwort, aber eine klare Zuordnung nach Geschäftsmodell:
| Situation | Empfehlung |
|---|---|
| Dienstleister, Berater, B2B | zulassen |
| Ratgeberportal mit Werbefinanzierung | abwägen |
| Kostenpflichtige Inhalte hinter Login | ohnehin nicht betroffen |
| Redaktion mit eigenem Lizenzgeschäft | Sperren prüfen |
Die Logik dahinter: Wer von Sichtbarkeit lebt und seine Inhalte nicht selbst verkauft, gewinnt durch Zulassen. Wer seine Inhalte lizenziert oder verkauft, gibt mit dem Zulassen ein Produkt her – für den ist Sperren eine legitime Geschäftsentscheidung, keine technische Panne.
Wie prüfst du, was aktuell bei dir eingestellt ist?
Ruf deine robots.txt direkt auf – unter deiner-domain.de/robots.txt – und sieh nach, ob dort User-Agent-Regeln für die oben genannten Crawler stehen. Häufig sperren Sicherheits-Plugins oder eine CDN-Konfiguration Bots, ohne dass es jemand bewusst eingestellt hat. Für einen strukturierten Blick auf Crawlbarkeit und Struktur nutzt du den kostenlosen AEO-Check.
Woher weißt du, ob eine Änderung gegriffen hat?
Über den Live-Test in der URL-Prüfung der Search Console – der zeigt sofort, was der Crawler aktuell sieht. Verlass dich nicht auf den Indexierungsbericht: Der basiert auf dem letzten echten Crawl, nicht auf einem Live-Test. Bei mir habe ich im Juli 2026 robots.txt-Regeln gegen Feed-URLs gesetzt und per Live-Test verifiziert – der Coverage-Bericht zeigte trotzdem noch wochenlang den alten Status. Genau das ist der Grund, warum robots.txt-Änderungen oft scheinbar nicht wirken: Sie wirken, der Bericht hinkt nur hinterher.
Lässt sich die Entscheidung später ändern?
Ja, jederzeit. Die robots.txt ist kein Einwegventil – du kannst einen Crawler heute sperren und in drei Monaten wieder zulassen. Zu beachten ist nur die Richtung der Zeitverzögerung: Eine Freigabe wirkt erst, wenn der Crawler das nächste Mal vorbeikommt, und eine Sperre entfernt dich nicht rückwirkend aus bereits trainierten Modellen. Was einmal ins Training geflossen ist, holst du damit nicht zurück – der Abruf zur Antwortzeit dagegen richtet sich immer nach dem aktuellen Stand deiner robots.txt.
Die Regeln konkret: robots.txt-Beispiele
Die häufigste Konfiguration für Unternehmen, die sichtbar sein wollen, aber ihr Training-Opt-out nutzen: Abruf erlauben, Training sperren. So sieht das aus (Stand September 2026):
# Abruf zur Antwortzeit erlauben – Sichtbarkeit in KI-Antworten
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
# Training optional aussperren – Sichtbarkeit bleibt erhalten
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
Den Googlebot nimmst du hier bewusst nicht auf – der gehört zur normalen Suche und darf nicht mitgesperrt werden. Willst du dagegen einfach überall sichtbar sein, lässt du alle zu und hältst nur eine Server-Regel bereit, falls ein Bot sich danebenbenimmt. Eine Ergänzung, die kein Ersatz für die robots.txt ist, aber die KI-Systeme zu deinen besten Seiten lenkt, ist die llms.txt.
Kann ich einzelne Verzeichnisse ausnehmen?
Ja. Statt Allow: / oder Disallow: / setzt du einen konkreten Pfad, zum Beispiel Disallow: /intern/ unter dem jeweiligen User-Agent. So kannst du einen Crawler grundsätzlich zulassen, aber sensible Bereiche ausnehmen. Achte darauf, die Regel unter den richtigen User-Agent zu schreiben – Regeln gelten pro Crawler, nicht global.
Dein nächster Schritt
Viele Websites sperren KI-Crawler aus, ohne es zu wissen – durch ein Plugin oder eine CDN-Regel, die niemand bewusst gesetzt hat. Im kostenlosen Erstcheck prüfe ich unter anderem, ob du KI-Crawler ohne Absicht ausschließt – schreib mir.



