Crawler
User-Agent
Kurz gesagt: Ein User-Agent ist die Kennung, mit der sich ein Browser, Crawler oder anderes Programm in jeder HTTP-Anfrage beim Server vorstellt; für Crawler ist er zugleich der Name, den robots.txt-Regeln ansprechen.
Definition: User-Agent
Das Header-Feld User-Agent ist in RFC 9110 definiert, der HTTP-Spezifikation der IETF von 2022. Es besteht aus einer oder mehreren Produktkennungen mit optionalen Kommentaren, die die anfragende Software beschreiben. Ein Client soll den Header laut RFC in jeder Anfrage mitsenden. Im SEO-Alltag meint der Begriff zwei verschiedene Dinge: den vollständigen String im Server-Log und das kurze Token, das in der robots.txt hinter „User-agent:“ steht. Beides ist nicht identisch, und keines von beiden beweist, wer wirklich anfragt.
So funktioniert es in der Praxis
Ein User-Agent-String ist länger, als die meisten erwarten. Googlebot Smartphone meldet sich laut Google-Dokumentation zum Beispiel so: Mozilla/5.0 (Linux; Android 6.0.1; Nexus 5X Build/MMB29P) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/W.X.Y.Z Mobile Safari/537.36 (compatible; Googlebot/2.1; +http://www.google.com/bot.html). Das W.X.Y.Z steht für die jeweils aktuelle Chrome-Version. Wer Logs filtert oder Server-Regeln schreibt, sollte deshalb mit Wildcards für die Versionsnummer arbeiten statt mit einem festen Wert, sonst greift die Regel nach dem nächsten Browser-Update nicht mehr.
In der robots.txt reicht dagegen das Token, etwa Googlebot oder GPTBot. Hier liegt eine wenig bekannte Falle. Manche Tokens tauchen nie im Log auf. Google-Extended hat laut Google keinen eigenen HTTP-User-Agent: Gecrawlt wird mit den normalen Google-Kennungen, das Token dient nur als Steuerzeichen für die Frage, ob Inhalte für Gemini-Training und Grounding genutzt werden dürfen. Wer im Log nach Google-Extended sucht, um zu prüfen, ob die Sperre wirkt, sucht vergeblich.
Der zweite Irrtum: Der User-Agent sei ein Ausweis. Er ist eine Selbstauskunft, die jeder beliebig setzen kann. Scraper geben sich gern als Googlebot aus, weil viele Server Googlebot bevorzugt behandeln. Google empfiehlt deshalb einen Reverse-DNS-Abgleich: Die IP aus dem Log muss auf googlebot.com, google.com oder googleusercontent.com zurückführen, und die Vorwärtsauflösung muss wieder dieselbe IP ergeben. Für große Mengen gibt es veröffentlichte IP-Listen. Google unterscheidet dabei drei Gruppen: allgemeine Crawler, die robots.txt immer beachten, Spezial-Crawler, die es je nach Vereinbarung tun oder nicht, und von Nutzern ausgelöste Abrufe, die robots.txt ignorieren. Dieselbe Logik gilt für KI-Crawler: Ein Abruf, den ein Mensch per Chat auslöst, verhält sich anders als ein Index-Crawler, auch wenn beide vom selben Anbieter stammen.
Für die Praxis heißt das: Werte Logs nach verifizierten Crawlern aus, nicht nach behaupteten. Pflege robots.txt-Gruppen mit exakt den Tokens, die die Anbieter dokumentieren. Und liefere nie abhängig vom User-Agent andere Inhalte aus als Menschen: Googles Spamrichtlinien nennen genau das, Text nur für Suchmaschinen-User-Agents einzublenden, als Beispiel für Cloaking. Ob die wichtigsten KI-Bots deine Seiten erreichen, prüft der KI-Crawler-Check mit den offiziellen Kennungen.
Praxisbeispiel
Ein Online-Magazin sperrt per Serverregel alle Anfragen mit „Googlebot“ im User-Agent, die nicht aus Googles IP-Bereichen kommen. In den Logs zeigt sich danach, dass mehrere Tausend Anfragen pro Tag von gefälschten Googlebots stammten, meist Scraper. Die echten Googlebot-Zugriffe bleiben unberührt, weil sie den Reverse-DNS-Abgleich bestehen.
Wenn du das nicht selbst aufbauen willst: Technik für KI-Sichtbarkeit: Crawler, Schema, llms.txt →
Was oft gefragt wird
Wie finde ich heraus, welcher User-Agent meine Seite besucht?
In den Zugriffslogs deines Servers oder CDN steht der User-Agent-String jeder Anfrage. Viele Hoster bieten eine Log-Ansicht im Kundenmenü. Für eine Bot-Auswertung filterst du nach Kennungen wie Googlebot, GPTBot oder PerplexityBot und prüfst die IPs gegen die Angaben der Anbieter.
Kann ich KI-Crawler über den User-Agent sperren?
Ja, per robots.txt mit dem dokumentierten Token oder per Serverregel. Die robots.txt wirkt aber nur bei Crawlern, die sie respektieren, und eine Serverregel nach User-Agent lässt sich durch gefälschte Kennungen umgehen. Verlässlicher ist eine Kombination mit IP-Prüfung oder Bot-Management.
Warum sehe ich Google-Extended nicht in meinen Logs?
Weil es keinen eigenen HTTP-User-Agent hat. Google crawlt mit den üblichen Kennungen wie Googlebot und nutzt das Token Google-Extended nur, um zu steuern, ob Inhalte für Gemini-Training und Grounding verwendet werden dürfen. Die Sperre wirkt also, ohne im Log sichtbar zu sein.
Weiter im Glossar
Quellen: RFC 9110: HTTP Semantics, Abschnitt 10.1.5 User-Agent (Stand September 2026) · Google: Google's common crawlers (Stand September 2026) · Google: Verify requests from Google crawlers and fetchers (Stand September 2026)
Dieser Eintrag beschreibt den Stand zum Prüfdatum. Hinweise auf Fehler oder neue Entwicklungen nehmen wir gern per E-Mail entgegen. Zurück zum Glossar
Wirst du in KI-Antworten genannt?30 Minuten, kostenlos, mit ehrlicher Einschätzung.
Reden wir 30 Minuten darüber
Kostenlos, unverbindlich und mit einer ehrlichen Einschätzung, ob sich GEO bei dir gerade lohnt.