deine-geo-agentur.de

Crawler

GPTBot

Von Felix Wilhelm · geprüft am 22. September 2026

Kurz gesagt: GPTBot ist der Crawler, mit dem OpenAI Webinhalte sammelt, die für das Training seiner generativen KI-Modelle verwendet werden können — getrennt vom Suchcrawler OAI-SearchBot.

GPTBot kurz erklärt

OpenAI, das US-Unternehmen hinter ChatGPT, veröffentlichte GPTBot im Jahr 2023. Laut OpenAI dient er dazu, Inhalte zu crawlen, die in das Training der KI-Grundlagenmodelle einfließen können. Ein Disallow signalisiert, dass Inhalte nicht dafür verwendet werden sollen. OpenAI veröffentlicht die IP-Bereiche als JSON-Datei und kennzeichnet Abrufe der robots.txt teils mit einem eigenen Marker im User-Agent. Für die Sichtbarkeit in der ChatGPT-Suche ist GPTBot nicht zuständig, das regelt OAI-SearchBot.

Auch genannt:GPT-BotOpenAI CrawlerOpenAI Trainings-Crawler

Einordnung und Hintergrund

Die Verwechslung der OpenAI-Bots ist einer der häufigsten Fehler in der Praxis. OpenAI unterscheidet in seiner Doku vier Agenten: GPTBot für Trainingsdaten, OAI-SearchBot für die Suchfunktionen von ChatGPT, ChatGPT-User für Abrufe, die eine Person in ChatGPT oder einem Custom GPT auslöst, und OAI-AdsBot, der Zielseiten von Anzeigen in ChatGPT prüft. Viele Websites haben nach 2023 reflexhaft „User-agent: GPTBot, Disallow: /“ eingetragen und damit an ihrer Sichtbarkeit in der ChatGPT-Suche nichts geändert, weder positiv noch negativ.

Laut OpenAI sind die Einstellungen unabhängig voneinander. Du kannst OAI-SearchBot zulassen, um in Suchergebnissen zu erscheinen, und GPTBot sperren, um Training auszuschließen. Ein Detail aus der Doku: Sind beide Bots erlaubt, nutzt OpenAI unter Umständen einen einzigen Abruf für beide Zwecke, um doppeltes Crawling zu vermeiden. Im Log taucht dann nur einer der beiden Namen auf, obwohl beide Zwecke bedient werden. Für ChatGPT-User gilt eine Besonderheit: Weil die Abrufe von Nutzern ausgelöst werden, gelten robots.txt-Regeln laut OpenAI möglicherweise nicht.

Wichtig ist die zeitliche Dimension. Eine Sperre wirkt nur auf künftige Abrufe. Was ein Modell bereits gelernt hat, bleibt Teil seines parametrischen Wissens bis zum nächsten Training. Umgekehrt erreicht Wissen, das GPTBot heute sammelt, Nutzer erst über ein künftiges Modell mit späterem Training-Cutoff. Dieser Weg ist langsam und nicht steuerbar, aber er prägt, was ein Modell ohne Websuche über eine Marke weiß.

Die Entscheidung über GPTBot ist letztlich eine inhaltliche. Sollen die eigenen Texte Teil künftiger Modelle werden? Verlage und Anbieter kostenpflichtiger Inhalte verneinen das oft, teils aus urheberrechtlichen Erwägungen, teils als Verhandlungsposition. Rechtlich lässt sich der Vorbehalt in Deutschland zusätzlich über einen maschinenlesbaren Text-und-Data-Mining-Vorbehalt erklären. Für ein mittelständisches Dienstleistungsunternehmen, das als Anbieter bekannt werden will, überwiegt meist der Nutzen, im Modellwissen vorzukommen. Ob die robots.txt das Gewollte tatsächlich ausdrückt, zeigt ein Test mit dem KI-Crawler-Check.

An einem Fall erklärt

Praxisbeispiel

Ein Anbieter von Online-Kursen für Steuerfachangestellte will seine kostenpflichtigen Lektionen nicht als Trainingsmaterial hergeben, aber in der ChatGPT-Suche mit seinen frei zugänglichen Ratgebern auftauchen. Er sperrt GPTBot für das Verzeichnis mit den Kursinhalten, lässt OAI-SearchBot für die gesamte Website zu und prüft anschließend im Server-Log anhand der von OpenAI veröffentlichten IP-Bereiche, welche Bots tatsächlich welche Verzeichnisse abrufen.

Wie wir das bei Kunden umsetzen, steht hier: Technik für KI-Sichtbarkeit: Crawler, Schema, llms.txt →

GPTBot: typische Fragen

Blockiert eine GPTBot-Sperre meine Sichtbarkeit in ChatGPT?

Nein, nicht in der ChatGPT-Suche. Dafür ist OAI-SearchBot zuständig, dessen Einstellung laut OpenAI unabhängig von GPTBot ist. Eine GPTBot-Sperre signalisiert nur, dass deine Inhalte nicht für das Training künftiger Modelle verwendet werden sollen.

Wie sperre ich GPTBot?

Mit einem Eintrag in der robots.txt für den User-Agent GPTBot, etwa Disallow für die ganze Website oder für einzelne Verzeichnisse. Wer die Sperre technisch durchsetzen will, ergänzt eine Serverregel, die sich an den von OpenAI veröffentlichten IP-Bereichen orientiert.

Werden bereits trainierte Inhalte durch eine Sperre entfernt?

Nein. Die Sperre wirkt nur auf künftige Crawls. Was in bereits trainierte Modelle eingeflossen ist, bleibt dort, bis ein neues Modell ohne diese Daten trainiert wird. Einen Löschweg für einzelne Websites aus bestehenden Modellen dokumentiert OpenAI in der Crawler-Doku nicht.

Begriffe im Umfeld

Quellen: OpenAI: Overview of OpenAI Crawlers (Stand September 2026)

Definitionen im Glossar sind redaktionell geprüft, ersetzen aber keine Beratung für deinen Einzelfall. Zurück zum Glossar

Reden wir 30 Minuten darüber

Kostenlos, unverbindlich und mit einer ehrlichen Einschätzung, ob sich GEO bei dir gerade lohnt.

Erstgespräch vereinbaren+49 174 164 5727

Nach oben scrollen