Technik
Crawl-Budget
Kurz gesagt: Das Crawl-Budget ist die Menge an URLs, die Google auf einem Hostnamen crawlen kann und crawlen will — relevant vor allem für sehr große oder sich schnell ändernde Websites.
Crawl-Budget: die Kurzfassung
Google definiert das Crawl-Budget als Zusammenspiel zweier Größen. Die Crawl-Kapazität (Hostload) begrenzt, wie viele parallele Verbindungen der Server verträgt; sie sinkt bei langsamen Antworten, 5xx-Fehlern und Statuscode 429. Der Crawl-Bedarf hängt von Größe, Aktualität, Qualität und Popularität der Inhalte ab. Das Budget gilt je Hostname: www.beispiel.de und shop.beispiel.de haben getrennte Kontingente. Abzugrenzen ist die Indexierung, denn nicht jede gecrawlte Seite wird aufgenommen.
Was du dazu wissen solltest
Google nennt selbst, für wen das Thema zählt: Websites mit mehr als einer Million Seiten, die sich etwa wöchentlich ändern, Websites ab 10.000 Seiten mit täglich wechselnden Inhalten und Websites, bei denen ein großer Teil der URLs im Status „Gefunden – zurzeit nicht indexiert“ hängt. Google bezeichnet diese Zahlen als grobe Schätzung. Für einen Handwerksbetrieb mit 80 Seiten ist das Crawl-Budget kein Thema; für ein Verzeichnis mit Filterseiten sehr wohl.
Der größte Hebel ist das wahrgenommene URL-Inventar. Google versucht, alle bekannten Adressen zu crawlen. Parameter-URLs, Sortierungen, Filterkombinationen, interne Suchergebnisse und Session-IDs vervielfachen dieses Inventar, ohne neuen Inhalt zu liefern. Auch Soft 404-Seiten und lange Weiterleitungsketten kosten Abrufe. Die Crawl-Kapazität teilen sich zudem alle Google-Crawler: Hoher Bedarf von AdsBot oder dem Shopping-Crawler kann Kapazität für den Googlebot binden.
Zwei Irrtümer halten sich hartnäckig. Erstens: noindex spart kein Crawl-Budget. Google ruft die Seite trotzdem ab und verwirft sie erst beim Lesen der Anweisung. Wer Abrufe sparen will, sperrt unwichtige Bereiche per robots.txt. Zweitens: Eine temporäre Sperre verschiebt kein Budget auf andere Seiten, solange die Kapazitätsgrenze nicht erreicht ist. Dauerhaft entfernte Seiten sollten 404 oder 410 liefern; das ist laut Google ein starkes Signal, die URL nicht erneut abzurufen, während gesperrte URLs lange in der Warteschlange bleiben.
Diagnose statt Vermutung: Der Crawling-Statistikbericht der Search Console zeigt Abrufe nach Statuscode, Dateityp und Zweck, dazu die durchschnittliche Antwortzeit. Serverlogs ergänzen das, weil dort auch Bots anderer Anbieter auftauchen. Für die KI-Suche ist ein schlankes URL-Inventar doppelt wertvoll: Wie oft KI-Crawler wie OAI-SearchBot oder PerplexityBot vorbeikommen, legt jeder Anbieter selbst fest und dokumentiert es nicht. Jede Anfrage, die auf einer Filterseite landet, fehlt bei den Seiten, die zitiert werden sollen.
Ein Beispiel aus der Praxis
Ein Immobilienportal hat rund 30.000 echte Exposés, erzeugt über Filter für Preis, Zimmerzahl und Stadtteil aber mehrere hunderttausend kombinierte Listen-URLs. Die Crawling-Statistik zeigt, dass der Großteil der Abrufe auf Filterseiten fällt, während neue Exposés tagelang im Status „Gefunden – zurzeit nicht indexiert“ stehen. Das Team sperrt Filterkombinationen per robots.txt, verlinkt nur kuratierte Stadtteilseiten und hält die Sitemap mit echtem lastmod aktuell.
Wenn du das nicht selbst aufbauen willst: Technik für KI-Sichtbarkeit: Crawler, Schema, llms.txt →
Was oft gefragt wird
Ab wann muss ich mich um Crawl-Budget kümmern?
Google nennt als grobe Orientierung Websites ab einer Million Seiten mit wöchentlichen Änderungen oder ab 10.000 Seiten mit täglichen Änderungen. Unabhängig von der Größe lohnt ein Blick, wenn viele URLs lange im Status „Gefunden – zurzeit nicht indexiert“ stehen. Kleine Websites mit wenigen hundert Seiten betrifft das praktisch nie.
Spart noindex Crawl-Budget?
Nein. Google muss die Seite abrufen, um das noindex zu lesen, der Abruf ist also bereits verbraucht. Google rät im eigenen Leitfaden ausdrücklich davon ab, noindex zum Sparen einzusetzen. Wer Bereiche gar nicht gecrawlt haben will, sperrt sie per robots.txt.
Kann ich Google anweisen, schneller zu crawlen?
Nicht direkt. Die Crawl-Kapazität steigt automatisch, wenn der Server schnell und fehlerfrei antwortet und Bedarf besteht. Du kannst nur die Voraussetzungen schaffen: kurze Antwortzeiten, wenige Fehler, ein sauberes URL-Inventar und eine aktuelle Sitemap. Bremsen lässt sich das Crawling dagegen, etwa über vorübergehende 503- oder 429-Antworten.
Haben Subdomains ein eigenes Crawl-Budget?
Ja. Google definiert eine Website für das Crawling als eindeutigen Hostnamen. www.beispiel.de und shop.beispiel.de werden getrennt betrachtet und haben jeweils eigene Kapazitätsgrenzen. Das ist bei Shop- oder Blog-Subdomains wichtig, die auf einem schwächeren Server laufen als die Hauptseite.
Das hängt damit zusammen
Quellen: Google Crawling Infrastructure: Optimize your crawl budget (Stand September 2026) · Google: How HTTP status codes affect Google's crawlers (Stand September 2026)
Wo Anbieter einen Begriff unterschiedlich verwenden, nennen wir beide Lesarten. Einen Fehler gefunden? Schreib uns, wir korrigieren ihn. Zurück zum Glossar
Wirst du in KI-Antworten genannt?30 Minuten, kostenlos, mit ehrlicher Einschätzung.
Reden wir 30 Minuten darüber
Kostenlos, unverbindlich und mit einer ehrlichen Einschätzung, ob sich GEO bei dir gerade lohnt.