SEO & KI-Suche
KI-Crawler in der robots.txt: Welche Bots Sie zulassen sollten
Lassen Sie die Crawler zu, die für KI-Suche und Abrufe auf Nutzeranfrage zuständig sind, und entscheiden Sie bei den Trainings-Crawlern bewusst. Sperren Sie niemals Googlebot oder Bingbot, sonst verschwinden Sie auch aus der normalen Suche. Das ist die Kurzfassung. Warum sie so lautet und wie Sie Ihre eigene robots.txt prüfen, steht unten.
Vier Arten von KI-Crawlern
Jeder große Anbieter betreibt inzwischen mehrere Bots mit unterschiedlichen Aufgaben. Wer sie in einen Topf wirft, sperrt schnell den falschen. Die folgende Liste ist dieselbe, die unser KI-Sichtbarkeits-Check verwendet.
KI-Suche: entscheiden über Nennungen in KI-Antworten
| Crawler | Anbieter | Wofür | Was eine Sperre betrifft |
|---|---|---|---|
OAI-SearchBot | OpenAI | Indexiert Seiten, damit die ChatGPT-Suche sie anzeigen und verlinken kann. | Ob Sie in der ChatGPT-Suche als verlinkte Quelle erscheinen können. |
PerplexityBot | Perplexity | Index-Crawler von Perplexity für die Antwortmaschine. | Ob Sie als Quelle in Perplexity-Antworten erscheinen können. |
Claude-SearchBot | Anthropic | Indexiert Inhalte für die Websuche von Claude (dokumentiert seit Februar 2026). | Ob die Websuche von Claude Sie zitieren kann. |
DuckAssistBot | DuckDuckGo | Sammelt Quellen für die KI-Antworten von DuckAssist (DuckDuckGo). | Aufnahme in DuckAssist-Antworten. |
YouBot | You.com | Crawler von You.com für dessen KI-Suchantworten. | Aufnahme in KI-Antworten von You.com. |
Abruf auf Nutzeranfrage: öffnen eine Seite, wenn jemand danach fragt
| Crawler | Anbieter | Wofür | Was eine Sperre betrifft |
|---|---|---|---|
ChatGPT-User | OpenAI | Ruft eine Seite live ab, wenn jemand in ChatGPT nach genau dieser URL fragt. Laut OpenAI gilt die robots.txt hier nicht unbedingt. | Ob ChatGPT Ihre Seite auf Nutzeranfrage öffnen kann. |
Claude-User | Anthropic | Live-Abruf, wenn jemand in Claude Ihre URL nennt (dokumentiert seit Februar 2026). | Ob Claude Ihre Seite auf Nutzeranfrage öffnen kann. |
Perplexity-User | Perplexity | Live-Abruf, wenn jemand in Perplexity direkt auf Ihre Seite verweist. | Ob Perplexity Ihre Seite auf Nutzeranfrage öffnen kann. |
Meta-ExternalFetcher | Meta | Live-Abruf für Meta AI (WhatsApp, Instagram, Facebook), wenn jemand einen Link teilt. | Ob Meta AI einen geteilten Link öffnen kann. |
Klassische Suche: auch Grundlage von KI-Funktionen
| Crawler | Anbieter | Wofür | Was eine Sperre betrifft |
|---|---|---|---|
Googlebot | Grundlage der Google-Suche und aus demselben Crawl auch der AI Overviews. AI Overviews lassen sich per robots.txt nicht sperren, ohne aus der Google-Suche zu fallen. | Google-Suche UND AI Overviews gemeinsam, selten sinnvoll. | |
Bingbot | Microsoft | Grundlage von Bing und Microsoft Copilot. | Bing und Microsoft Copilot. |
Applebot | Apple | Grundlage für Vorschläge in Siri und Spotlight. Teilt sich den Token mit dem klassischen Apple-Crawl. | Vorschläge in Siri und Spotlight. |
Amazonbot | Amazon | Speist Alexa-Antworten und Amazon-Dienste, auch für klassische Indexierung genutzt. | Alexa-Antworten und Amazon-Indexierung. |
Modelltraining: eine Frage der Inhaltsrechte, nicht der Sichtbarkeit
| Crawler | Anbieter | Wofür | Was eine Sperre betrifft |
|---|---|---|---|
GPTBot | OpenAI | Crawlt für das Training von OpenAI-Modellen. Getrennt von der ChatGPT-Suche: Eine Sperre entfernt Sie nicht aus deren Quellen. | Ob Ihre Inhalte zum Training von OpenAI-Modellen genutzt werden. |
Google-Extended | Schalter für Training und Grounding von Gemini-Modellen (Gemini-Apps, Vertex AI). Beeinflusst weder die Google-Suche noch AI Overviews. | Ob Ihre Inhalte Gemini trainieren, nicht Google-Suche oder AI Overviews. | |
ClaudeBot | Anthropic | Allgemeiner Crawler von Anthropic. Getrennt von Claude-SearchBot (Suche) und Claude-User (Live-Abruf). | Das allgemeine Crawling Ihrer Website durch Anthropic. |
anthropic-ai (veraltet) | Anthropic | Veralteter User-Agent von Anthropic, ersetzt durch ClaudeBot / Claude-SearchBot / Claude-User. Steht noch in älteren robots.txt-Dateien. | Veraltetes Anthropic-Crawling (überwiegend historisch). |
CCBot | Common Crawl | Bot von Common Crawl. Der offene Datensatz wird für das Training vieler Sprachmodelle genutzt, eine Sperre wirkt hier also breit. | Aufnahme in den Common-Crawl-Datensatz, den viele Modelle nutzen. |
Google-CloudVertexBot | Ruft Websites für Vertex-AI-Agenten im Auftrag von Google-Cloud-Kunden ab. | Ob Vertex-AI-Agenten von Kunden Ihre Seiten abrufen. | |
Applebot-Extended | Apple | Schalter für das Training von Apple Intelligence. Beeinflusst nicht die Indexierung für Siri/Spotlight. | Ob Ihre Inhalte Apple Intelligence trainieren. |
Meta-ExternalAgent | Meta | Crawlt für das Training der Llama-Modelle von Meta. | Ob Ihre Inhalte die Modelle von Meta trainieren. |
Bytespider | ByteDance | Crawler von ByteDance (TikTok / Doubao), bekannt für hohe Anfragelast. | Modelltraining bei ByteDance und Crawling-Last. |
cohere-ai | Cohere | Crawler von Cohere für dessen Unternehmensmodelle. | Ob Ihre Inhalte Cohere-Modelle trainieren. |
Die Entscheidung: was zulassen, was sperren
KI-Suche und Abruf auf Nutzeranfrage zulassen. Diese Bots entscheiden darüber, ob Ihre Seite in einer KI-Antwort als Quelle erscheinen kann. Wer OAI-SearchBot, PerplexityBot oder Claude-SearchBot sperrt, nimmt sich diese Möglichkeit bei ChatGPT, Perplexity und Claude.
Klassische Such-Crawler nie sperren. Googlebot ist die Grundlage der Google-Suche und damit auch der AI Overviews. Eine Sperre nimmt Sie aus beidem. Dasselbe gilt für Bingbot und die Suche bei Bing und Microsoft Copilot.
Trainings-Crawler: Ihre Entscheidung. GPTBot, ClaudeBot, Google-Extended, CCBot und andere sammeln Inhalte für das Training von Sprachmodellen. Ob Sie das zulassen, ist eine Frage der Inhaltsrechte. Mit der Sichtbarkeit in den Suchfunktionen dieser Anbieter hat es laut deren Dokumentation nichts zu tun. Verlage und Anbieter kostenpflichtiger Inhalte sperren sie oft, Dienstleister lassen sie meist offen.
Beispiel: eine robots.txt, die nur Training sperrt
So sieht eine robots.txt aus, die alle Such- und Abruf-Crawler zulässt und die wichtigsten Trainings-Crawler aussperrt:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: *
Allow: /
Sitemap: https://ihre-firma.de/sitemap.xml
Wollen Sie alles erlauben, reichen die letzten drei Zeilen. Ersetzen Sie die Adresse der Sitemap durch Ihre eigene.
Was die robots.txt nicht regelt
Die robots.txt ist eine Bitte, keine Mauer. Vier Dinge steuert sie nicht:
- Abrufe auf Nutzeranfrage. Fragt jemand in ChatGPT oder Perplexity nach einer bestimmten Seite, behalten sich beide Anbieter vor, die robots.txt nicht anzuwenden. OpenAI schreibt dazu, die Regeln gälten dann möglicherweise nicht.
- Ihre Firewall und Ihr CDN. Viele Anbieter von Bot-Schutz haben eigene Schalter für KI-Crawler. Bei neuen Cloudflare-Zonen etwa können eine Sperre für KI-Bots und eine verwaltete robots.txt bereits aktiv sein, ohne dass jemand im Team das bewusst eingestellt hat. Die robots.txt erlaubt dann alles, und die Crawler kommen trotzdem nicht durch.
- Google AI Overviews. Wer bei Google in der normalen Suche bleiben, aber nicht in den KI-Funktionen erscheinen will, erreicht das nicht über die robots.txt, sondern seit Ende August 2026 über eine eigene Einstellung in der Search Console. Mehr dazu im Artikel über Google AI Overviews.
- Bereits gesammelte Inhalte. Eine neue Sperre wirkt ab dem nächsten Abruf. Was vorher erfasst wurde, bleibt davon unberührt.
So prüfen Sie, ob die Crawler wirklich ankommen
- robots.txt prüfen. Rufen Sie
ihre-firma.de/robots.txtim Browser auf oder lassen Sie den KI-Sichtbarkeits-Check prüfen, ob Ihre robots.txt die Such-Crawler hereinlässt. Er zeigt für jede Sperre, welche Regel sie auslöst. - Firewall und CDN prüfen. Suchen Sie in den Einstellungen Ihres Hosters oder CDN nach Begriffen wie „AI bots“, „KI-Crawler“ oder „Bot-Schutz“.
- Server-Logs ansehen. Filtern Sie die Zugriffe nach den Namen aus der Tabelle oben. Tauchen
OAI-SearchBotoderPerplexityBotnie auf, obwohl die robots.txt sie erlaubt, liegt die Sperre meist eine Ebene davor. - Echtheit prüfen. Den Namen eines Crawlers kann jeder vortäuschen. OpenAI veröffentlicht die IP-Bereiche seiner Crawler, Google beschreibt die Prüfung per Reverse-DNS. Wer Bots sperrt oder erlaubt, sollte sich darauf stützen und nicht allein auf den Namen.
Was nach dem Zugang kommt, also wie ChatGPT und Google entscheiden, welche Seite sie nennen, erklärt der Artikel darüber, wie KI-Suchsysteme ihre Quellen auswählen.
Häufige Fragen
Verschwinde ich aus der ChatGPT-Suche, wenn ich GPTBot sperre?
Nein. GPTBot sammelt laut OpenAI Inhalte für das Training von Modellen. Für die Suchergebnisse in ChatGPT ist OAI-SearchBot zuständig. Sie können GPTBot sperren und OAI-SearchBot zulassen.
Muss ich jeden KI-Crawler einzeln erlauben?
Nein. Eine robots.txt, die mit „User-agent: *“ alles erlaubt, lässt auch alle KI-Crawler zu. Einzeln nennen müssen Sie nur die Bots, die Sie sperren wollen, oder solche, für die Sie andere Regeln brauchen als für den Rest.
Wie schnell wirkt eine Änderung an der robots.txt?
Sobald der jeweilige Crawler die Datei neu abruft. Google speichert die robots.txt laut eigener Dokumentation in der Regel bis zu 24 Stunden zwischen. Andere Anbieter machen dazu keine genauen Angaben.
Kann ich KI-Crawler mit der robots.txt zuverlässig aussperren?
Nur solche, die sich daran halten. Die großen Anbieter tun das für ihre selbstständig arbeitenden Crawler. Für Abrufe, die ein Nutzer auslöst, behalten sich OpenAI und Perplexity vor, die robots.txt nicht anzuwenden. Wer etwas wirklich schützen muss, braucht eine Anmeldung oder eine Sperre auf dem Server.