Technik
KI-Crawler blockieren
Kurz gesagt: KI-Crawler zu blockieren heißt, einzelnen Bots von KI-Anbietern den Zugriff per robots.txt oder serverseitig zu verweigern — mit unterschiedlichen Folgen für Training, Suche und Live-Abruf.
Was bedeutet KI-Crawler blockieren?
Das Blockieren von KI-Crawlern geschieht auf zwei Ebenen. Die robots.txt ist eine Bitte nach RFC 9309, die seriöse Anbieter für ihre automatischen Crawler befolgen. Eine Regel in Webserver, Firewall oder CDN ist eine tatsächliche Sperre, die auch für Bots greift, die robots.txt ignorieren. Entscheidend ist die Auswahl: Wer den Trainings-Crawler sperrt, schließt Inhalte vom künftigen Modelltraining aus; wer den Such-Crawler sperrt, verschwindet aus den Suchantworten des Anbieters. Beides lässt sich bei OpenAI, Anthropic und Google getrennt steuern.
So funktioniert es in der Praxis
Die differenzierte Sperre ist in wenigen Zeilen erledigt. Ein Beispiel, das Training ausschließt und Suche zulässt: User-agent: GPTBot / Disallow: /, User-agent: ClaudeBot / Disallow: /, User-agent: Google-Extended / Disallow: /, während OAI-SearchBot, Claude-SearchBot und PerplexityBot keinen eigenen Block erhalten und damit unter die allgemeinen Regeln fallen. Laut OpenAI dauert es rund 24 Stunden, bis die ChatGPT-Suche eine geänderte robots.txt berücksichtigt. Anthropic weist darauf hin, dass IP-Sperren das Lesen der robots.txt verhindern und dadurch keine verlässliche Abmeldung sind.
Eine pauschale Sperre aller Bots mit KI-Bezug ist für Unternehmen, die gefunden werden wollen, fast immer ein Eigentor. Sie kostet die Präsenz in den Systemen, in denen Kunden inzwischen recherchieren, und verhindert nicht, dass die Marke genannt wird — nur basiert die Nennung dann ausschließlich auf dem, was Dritte schreiben. Für Verlage und Anbieter kostenpflichtiger Inhalte sieht die Abwägung anders aus: Dort kann der Trainingsausschluss eine bewusste Verhandlungsposition sein, etwa über Modelle wie Pay per Crawl.
Für Google gibt es seit August 2026 drei getrennte Hebel. Google-Extended steuert Training und Grounding für Gemini-Apps und Vertex AI. Die Einstellung „Search generative AI“ in der Search Console schließt eine Website aus AI Overviews, AI Mode und den KI-Funktionen in Discover aus; laut Google greift das meist innerhalb weniger Tage, ohne das normale Ranking zu beeinflussen. Und nosnippet im Meta-Robots-Tag verhindert, dass Inhalte als direkte Eingabe für diese Funktionen dienen, begrenzt aber auch das Snippet in der klassischen Suche.
Die häufigste Sperre ist die ungewollte. Bot-Schutz, WAF-Regeln und CDN-Voreinstellungen blockieren KI-Crawler oft, ohne dass jemand es entschieden hat. Cloudflare fragt seit Juli 2025 bei jeder neuen Domain, ob KI-Crawler zugelassen werden. Prüfe deshalb beides: was die robots.txt sagt und welchen Statuscode die Bots tatsächlich erhalten. Einen ersten Überblick gibt der KI-Crawler-Check, die Bot-Übersicht steht im Eintrag KI-Crawler.
Praxisbeispiel
Eine Steuerkanzlei will nicht, dass ihre ausführlichen Fachbeiträge in Trainingsdaten landen, aber in ChatGPT und Perplexity als Quelle erscheinen. Sie sperrt GPTBot, ClaudeBot und Google-Extended in der robots.txt, lässt die Such-Crawler zu und prüft im Hosting-Panel, dass die Firewall OAI-SearchBot und PerplexityBot nicht mit 403 abweist. Die Einstellung für generative KI-Funktionen in der Search Console bleibt auf „einschließen“, weil AI Overviews für ihre Mandantensuche relevant sind.
In der Praxis setzen wir das so um: Technik für KI-Sichtbarkeit: Crawler, Schema, llms.txt →
Häufige Fragen zu KI-Crawler blockieren
Was passiert, wenn ich alle KI-Crawler blockiere?
Deine Inhalte fließen nicht mehr in künftiges Training und können von den Suchfunktionen nicht mehr abgerufen oder verlinkt werden. Die Marke kann trotzdem in Antworten auftauchen, dann aber nur auf Grundlage von Trainingswissen und dem, was andere Websites über dich schreiben. Du gibst damit die Kontrolle über die Quelle ab.
Wie sperre ich nur das Training, nicht die Suche?
Sperre in der robots.txt die Trainings-Token GPTBot, ClaudeBot und Google-Extended und lass OAI-SearchBot, Claude-SearchBot und PerplexityBot zu. OpenAI und Anthropic dokumentieren, dass diese Einstellungen unabhängig voneinander wirken. Beachte: Google-Extended steuert neben dem Training auch das Grounding in Gemini-Apps.
Kann ich mich aus Google AI Overviews ausschließen, ohne aus der Suche zu fallen?
Ja, seit August 2026 über die Einstellung „Search generative AI“ in der Search Console. Sie schließt die Website aus AI Overviews, AI Mode und den KI-Funktionen in Discover aus, ist laut Google aber kein Rankingsignal für die übrige Suche. Das Training steuert weiterhin Google-Extended.
Reicht robots.txt, um KI-Crawler sicher auszusperren?
Nicht in jedem Fall. OpenAI und Perplexity schreiben, dass nutzerausgelöste Abrufe robots.txt nicht immer befolgen, und unseriöse Scraper ignorieren die Datei ohnehin. Eine verbindliche Sperre gelingt nur serverseitig, etwa per Firewall-Regel mit User-Agent und IP-Bereichen oder über einen Login.
Weiter im Glossar
Quellen: OpenAI: Overview of OpenAI Crawlers (Stand September 2026) · Search Console-Hilfe: Search generative AI control (Stand September 2026) · Cloudflare: Pressemitteilung vom 1. Juli 2025 (Stand September 2026)
Dieser Eintrag beschreibt den Stand zum Prüfdatum. Hinweise auf Fehler oder neue Entwicklungen nehmen wir gern per E-Mail entgegen. Zurück zum Glossar
Wirst du in KI-Antworten genannt?30 Minuten, kostenlos, mit ehrlicher Einschätzung.
Reden wir 30 Minuten darüber
Kostenlos, unverbindlich und mit einer ehrlichen Einschätzung, ob sich GEO bei dir gerade lohnt.