deine-geo-agentur.de

Technik

KI-Crawler

Von Felix Wilhelm · geprüft am 22. September 2026

Kurz gesagt: KI-Crawler sind automatisierte Programme, mit denen KI-Anbieter Webinhalte abrufen — für das Training von Modellen, für einen eigenen Suchindex oder live während einer Nutzeranfrage.

KI-Crawler: die Kurzfassung

Ein KI-Crawler ist ein Bot, der Websites im Auftrag eines KI-Unternehmens abruft und sich über einen eigenen User-Agent-String zu erkennen gibt. Die großen Anbieter trennen drei Zwecke: Trainings-Crawler wie GPTBot (OpenAI) und ClaudeBot (Anthropic), Such-Crawler wie OAI-SearchBot, Claude-SearchBot und PerplexityBot sowie nutzerausgelöste Abrufe wie ChatGPT-User, Claude-User und Perplexity-User. Google-Extended ist kein eigener Crawler, sondern ein Steuerungs-Token in der robots.txt für Gemini-Training und -Grounding.

Auch genannt:AI-CrawlerKI-BotsLLM-CrawlerAI Bots

Was dahintersteckt

Die Dreiteilung ist der Schlüssel zu jeder Entscheidung. OpenAI schreibt, dass seine Einstellungen unabhängig voneinander wirken: Wer OAI-SearchBot erlaubt und GPTBot sperrt, erscheint in den Suchergebnissen von ChatGPT, ohne Inhalte für das Training freizugeben. Nach einer Änderung der robots.txt brauchen die Suchsysteme laut OpenAI etwa 24 Stunden. Anthropic beschreibt dasselbe Muster mit ClaudeBot, Claude-SearchBot und Claude-User; wer Claude-SearchBot sperrt, verringert laut Anthropic seine Sichtbarkeit in Suchantworten.

Ein wichtiges Detail steckt in den nutzerausgelösten Abrufen. OpenAI schreibt zu ChatGPT-User, dass robots.txt-Regeln dort möglicherweise nicht greifen, weil ein Mensch den Abruf auslöst; Perplexity erklärt für Perplexity-User, dass dieser Abruf robots.txt in der Regel ignoriert. Anthropic dagegen gibt an, auch Claude-User über robots.txt steuerbar zu machen. Wer glaubt, mit einer Zeile alles geregelt zu haben, sollte die Dokumentation jedes Anbieters einzeln lesen. Bei Google gilt: Google-Extended steuert Training und Grounding in Gemini-Apps und Vertex AI, hat aber keinen Einfluss auf die Google-Suche und damit auch nicht auf AI Overviews.

In der Praxis scheitert Sichtbarkeit seltener an der robots.txt als an der Infrastruktur. Web Application Firewalls, Bot-Schutz und CDN-Regeln blockieren unbekannte Bots oft pauschal. Cloudflare fragt seit Juli 2025 jede neu angelegte Domain, ob KI-Crawler zugelassen werden sollen, und hat damit die Voreinstellung vieler Websites verändert. Perplexity empfiehlt in seiner Doku, eigene Bots per User-Agent und veröffentlichter IP-Liste in der Firewall freizugeben. Echte Bots lassen sich über diese IP-Listen von Nachahmern unterscheiden, die nur den Namen im User-Agent tragen.

Der erste Prüfschritt ist deshalb ein Blick ins Serverlog: Kommen die relevanten Bots an, und welchen Statuscode erhalten sie? Danach folgt die Frage, welche Zwecke du erlauben willst. Einen schnellen Überblick über die eigene robots.txt liefert der KI-Crawler-Check; wie sich gezielt sperren lässt, beschreibt der Eintrag KI-Crawler blockieren.

An einem Fall erklärt

Praxisbeispiel

Ein Maschinenbauer taucht in ChatGPT-Antworten zu seinem Spezialgebiet nie als Quelle auf, obwohl die robots.txt alle Bots zulässt. Die Auswertung der Serverlogs zeigt: Die Firewall des Hosters beantwortet Anfragen von OAI-SearchBot und PerplexityBot mit Status 403. Nach einer Freigabe-Regel, die User-Agent und die veröffentlichten IP-Bereiche der Anbieter kombiniert, erhalten die Bots Status 200, während Nachahmer mit gefälschtem User-Agent weiter blockiert bleiben.

Die passende Leistung dazu: Technik für KI-Sichtbarkeit: Crawler, Schema, llms.txt →

Fragen, die dazu oft kommen

Welche KI-Crawler sollte ich zulassen?

Wer in KI-Antworten genannt werden will, lässt mindestens die Such-Crawler zu: OAI-SearchBot, Claude-SearchBot und PerplexityBot. Über Trainings-Crawler wie GPTBot und ClaudeBot entscheidest du getrennt. Die Anbieter dokumentieren, dass sich beide Zwecke unabhängig voneinander steuern lassen.

Halten sich KI-Crawler an die robots.txt?

OpenAI, Anthropic und Perplexity sagen zu, ihre automatischen Crawler über robots.txt steuerbar zu machen. Bei nutzerausgelösten Abrufen gilt das nicht überall: OpenAI und Perplexity schreiben, dass robots.txt dort nicht oder nicht immer greift. Wer Zugriff sicher verhindern will, braucht eine serverseitige Sperre.

Wie erkenne ich KI-Crawler im Serverlog?

Filtere nach den User-Agent-Namen wie GPTBot, OAI-SearchBot, ChatGPT-User, ClaudeBot, Claude-SearchBot oder PerplexityBot. Weil jeder diese Namen fälschen kann, gleichst du die Quell-IP mit den veröffentlichten IP-Listen der Anbieter ab. Nur dann ist klar, dass der Abruf wirklich vom genannten Bot stammt.

Blockiert Google-Extended die Nutzung in AI Overviews?

Nein. Google-Extended steuert laut Google die Nutzung für Gemini-Training und Grounding in Gemini-Apps und Vertex AI, nicht die Google-Suche. Für AI Overviews und AI Mode gibt es seit August 2026 eine eigene Einstellung in der Search Console sowie die Snippet-Steuerung per nosnippet.

Begriffe im Umfeld

Quellen: OpenAI: Overview of OpenAI Crawlers (Stand September 2026) · Anthropic: Does Anthropic crawl data from the web? (Stand September 2026) · Google: Common crawlers (Google-Extended) (Stand September 2026)

Definitionen im Glossar sind redaktionell geprüft, ersetzen aber keine Beratung für deinen Einzelfall. Zurück zum Glossar

Reden wir 30 Minuten darüber

Kostenlos, unverbindlich und mit einer ehrlichen Einschätzung, ob sich GEO bei dir gerade lohnt.

Erstgespräch vereinbaren+49 174 164 5727

Nach oben scrollen