Technik
robots.txt
Kurz gesagt: Die robots.txt ist eine Textdatei im Wurzelverzeichnis eines Hosts, die Crawlern mitteilt, welche Pfade sie abrufen dürfen — als Konvention nach RFC 9309, nicht als technische Sperre.
robots.txt: die Kurzfassung
Die robots.txt folgt dem Robots Exclusion Protocol, das Martijn Koster 1994 entworfen hat und die IETF im September 2022 als RFC 9309 standardisiert hat. Sie besteht aus Gruppen, die mit einer oder mehreren User-agent-Zeilen beginnen und Allow- und Disallow-Regeln enthalten; zusätzlich kann sie Sitemaps nennen. Sie gilt je Host und Protokoll. Die Datei steuert das Crawling, nicht die Indexierung: Eine gesperrte URL kann ohne Inhalt im Index stehen, wenn andere Seiten auf sie verlinken. Für die Indexsteuerung ist das Meta-Robots-Tag zuständig.
Was dahintersteckt
Die Auswertung folgt klaren Regeln, die RFC 9309 und Google gleich beschreiben. Ein Crawler sucht die Gruppe, deren User-agent ihn am genauesten bezeichnet, und befolgt nur diese; die Reihenfolge der Gruppen spielt keine Rolle. Innerhalb der Gruppe gewinnt die spezifischste Regel, also der längste passende Pfad; bei Gleichstand gewinnt Allow. Groß- und Kleinschreibung zählt beim Pfad, nicht beim Bot-Namen. Google liest höchstens 500 KiB und ignoriert alles danach, zwischengespeichert wird die Datei in der Regel bis zu 24 Stunden. Crawl-delay ist kein Teil des Standards; Google ignoriert es, Anthropic unterstützt es nach eigener Angabe.
Wenig bekannt, aber folgenreich ist der Umgang mit Fehlern. Liefert die robots.txt einen 4xx-Code, etwa 404, darf ein Crawler laut RFC alles abrufen. Liefert sie einen 5xx-Code oder ist der Server nicht erreichbar, muss er von einer vollständigen Sperre ausgehen. Ein fehlerhaft konfigurierter Server, der die robots.txt mit 500 beantwortet, sperrt damit ungewollt die ganze Website.
Der häufigste Fehler in der KI-Praxis ist ein Missverständnis der Gruppenlogik. Legt man für GPTBot eine eigene Gruppe mit einer einzigen Disallow-Zeile an, gelten für GPTBot alle Regeln der Wildcard-Gruppe User-agent: * nicht mehr, auch deren Sperren für interne Suche oder Warenkorb. Jede spezifische Gruppe muss deshalb vollständig sein. Umgekehrt sperrt User-agent: * mit Disallow: / auch alle Such-Crawler der KI-Anbieter, die keine eigene Gruppe haben.
Für die KI-Suche ist die Datei das wichtigste Steuerungsinstrument, weil OpenAI, Anthropic, Perplexity und Google ihre Tokens dort auswerten und Training und Suche getrennt steuerbar machen; Details stehen unter KI-Crawler blockieren. Sie ist aber keine Sicherheitsmaßnahme: RFC 9309 betont selbst, dass die Datei gesperrte Pfade öffentlich sichtbar macht. Vertrauliches gehört hinter einen Login. Zur Indexsteuerung dient das Meta-Robots-Tag; ob die wichtigsten Bots durchkommen, zeigt der KI-Crawler-Check.
An einem Fall erklärt
Ein Onlineshop für Kaffeemaschinen sperrt Warenkorb und interne Suche in der Wildcard-Gruppe und legt später eine Gruppe für GPTBot mit der Zeile Disallow: / an. Weil der Shop Training verhindern, aber in der ChatGPT-Suche erscheinen will, prüft er die Wirkung: OAI-SearchBot hat keine eigene Gruppe und folgt damit der Wildcard-Gruppe, darf also Produktseiten abrufen und bleibt aus Warenkorb und Suche ausgesperrt. Die Sitemap-Zeile steht am Ende der Datei.
In der Praxis setzen wir das so um: Technik für KI-Sichtbarkeit: Crawler, Schema, llms.txt →
Häufige Fragen zu robots.txt
Ist die robots.txt rechtlich bindend?
Die Datei selbst ist eine technische Konvention, kein Vertrag; seriöse Crawler halten sich daran, andere nicht. Rechtlich kann sie als maschinenlesbarer Nutzungsvorbehalt für Text- und Data-Mining nach § 44b UrhG dienen; ob sie dafür allein genügt, ist juristisch nicht abschließend geklärt. Für einen sicheren Ausschluss brauchst du eine serverseitige Sperre oder einen Login.
Wie halte ich eine Seite aus dem Google-Index?
Mit noindex im Meta-Robots-Tag oder im X-Robots-Tag-Header. Die Seite darf dabei nicht per robots.txt gesperrt sein, sonst liest Google die Anweisung nie. Eine Disallow-Regel allein verhindert nur das Crawling; die URL kann ohne Inhalt trotzdem in den Ergebnissen erscheinen.
Was passiert, wenn meine robots.txt nicht erreichbar ist?
Das hängt vom Statuscode ab. Bei 404 oder einem anderen 4xx-Code dürfen Crawler laut RFC 9309 alles abrufen. Bei 5xx-Fehlern oder Zeitüberschreitung müssen sie von einer vollständigen Sperre ausgehen. Ein Server, der die robots.txt mit 500 beantwortet, blockiert damit unbemerkt das gesamte Crawling.
Gilt die robots.txt für Subdomains mit?
Nein. Jede Kombination aus Protokoll, Host und Port braucht ihre eigene Datei. Die robots.txt von www.beispiel.de gilt nicht für shop.beispiel.de. Anthropic weist in seiner Dokumentation ausdrücklich darauf hin, die Sperre für jede Subdomain einzeln zu setzen.
Begriffe im Umfeld
Quellen: RFC 9309: Robots Exclusion Protocol (Stand September 2026) · Google: How Google interprets the robots.txt specification (Stand September 2026)
Definitionen im Glossar sind redaktionell geprüft, ersetzen aber keine Beratung für deinen Einzelfall. Zurück zum Glossar
Wirst du in KI-Antworten genannt?30 Minuten, kostenlos, mit ehrlicher Einschätzung.
Reden wir 30 Minuten darüber
Kostenlos, unverbindlich und mit einer ehrlichen Einschätzung, ob sich GEO bei dir gerade lohnt.