deine-geo-agentur.de

Leistung

KI-Crawler, Schema Markup, llms.txt: die Technik, damit KI-Systeme reinkommen

Die beste Seite nützt nichts, wenn der KI-Crawler einen 403 bekommt oder der Text erst im Browser nachgeladen wird. Wir prüfen Zugang, Auslieferung und Auszeichnung deiner Website und setzen die Korrekturen um.

Erstgespräch vereinbaren+49 174 164 5727

Kurz gesagt: Der technische Teil von GEO stellt sicher, dass KI-Crawler deine Seiten abrufen dürfen und können, dass der Inhalt ohne clientseitiges Rendering im HTML steht und dass Organisation, Leistungen und Definitionen als zusammenhängender JSON-LD-Graph ausgezeichnet sind.

Woran es in der Praxis meistens scheitert

Wir sehen regelmäßig Websites, die seit Monaten für OAI-SearchBot oder PerplexityBot nicht erreichbar sind. Nicht wegen einer bewussten Entscheidung, sondern weil ein Bot-Schutz im Hosting oder CDN unbekannte User-Agents blockiert. Die robots.txt erlaubt alles, die Firewall davor lässt trotzdem niemanden durch. Der Betreiber wundert sich über fehlende Nennungen, während im Log seit einem halben Jahr 403er stehen.

Das Problem ist dokumentiert: OpenAI und Perplexity veröffentlichen für ihre Crawler nicht nur die User-Agent-Strings, sondern auch IP-Listen als JSON-Datei. Perplexity empfiehlt in seiner Dokumentation ausdrücklich, Firewall-Regeln aus User-Agent und IP-Adresse zu kombinieren und diese Anfragen gezielt durchzulassen. Wer nur auf den User-Agent schaut, lässt Fälschungen durch. Wer nur blockt, sperrt die Echten aus.

Der zweite Klassiker ist Rendering. Googlebot führt clientseitigen Code aus, wenn auch mit Verzögerung. Bei KI-Crawlern sehen wir in Abruf-Tests regelmäßig, dass nur das ausgelieferte HTML ankommt. Was erst nach dem Laden im Browser erscheint, ist für sie schlicht nicht vorhanden. Deshalb gehört der wesentliche Inhalt serverseitig ins HTML.

Welche Crawler du unterscheiden solltest

„KI-Crawler“ ist keine einheitliche Gruppe. Die Anbieter trennen selbst zwischen Bots für Training, für den Suchindex und für Abrufe, die ein Nutzer auslöst. Für die Sichtbarkeit in Antworten sind vor allem die beiden letzten wichtig.

ZweckBeispieleFolge einer Sperre
TrainingGPTBot, ClaudeBot, Token Google-ExtendedInhalte fließen nicht in künftiges Training ein. Kann eine bewusste Entscheidung sein. Google-Extended wirkt laut Google nicht auf die Google-Suche, steuert aber auch das Grounding in Gemini-Apps.
SuchindexOAI-SearchBot, PerplexityBotDeine Seiten erscheinen nicht als Quelle in ChatGPT-Suche oder Perplexity.
Nutzer-AbrufChatGPT-User, Perplexity-UserBeide Anbieter geben an, dass robots.txt hier nicht oder nur eingeschränkt greift. Blockieren lässt sich das nur per Firewall.

Stand der Angaben: September 2026, laut Dokumentation von OpenAI, Perplexity und Google. Die Bot-Namen ändern sich gelegentlich, deshalb prüfen wir vor jeder Umsetzung neu.

So läuft es ab

  1. 1

    Technik-Check

    im GEO-Audit, 2–3 Wochen

    Wir rufen deine wichtigsten Seiten mit den echten User-Agent-Strings ab, vergleichen die Antworten mit einem normalen Browser-Abruf, lesen robots.txt, Sitemaps und Statuscodes und prüfen, welcher Inhalt ohne Rendering im HTML steht. Wenn du Server- oder CDN-Logs bereitstellst, werten wir die Zugriffe der Bots aus.

  2. 2

    Crawler-Politik festlegen

    Gemeinsam mit dir: Welche Bots sollen rein, welche nicht? Training sperren und Suche erlauben ist eine legitime Entscheidung, pauschal alles sperren fast nie. Das Ergebnis halten wir schriftlich fest, damit es beim nächsten Hosting-Wechsel nicht verloren geht.

  3. 3

    Umsetzung

    in der Aufbauphase, 4–8 Wochen

    robots.txt, Firewall-Regeln, Auslieferung der Kerninhalte im HTML, strukturierte Daten, Sitemaps, IndexNow und llms.txt. Mit Zugang setzen wir selbst um, sonst bekommt deine Entwicklung oder dein Hoster eine konkrete Anleitung.

  4. 4

    Nachtest und Kontrolle

    danach monatlich

    Nach der Umsetzung wiederholen wir den Abruf-Test. In der laufenden Betreuung kontrollieren wir monatlich, ob Updates, Plugins oder CDN-Änderungen den Zugang wieder geschlossen haben. Das passiert häufiger, als man denkt.

Was du konkret bekommst

  • Prüfprotokoll je User-Agent: HTTP-Status, Weiterleitungen, sichtbarer Inhalt, Abweichung zum Browser.
  • Priorisierte Befundliste mit Aufwand und Zuständigkeit (wir, deine Entwicklung, dein Hoster).
  • robots.txt-Entwurf nach Zweck der Bots getrennt, mit Kommentar zu jeder Regel.
  • Regelvorschlag für Firewall oder CDN auf Basis der veröffentlichten IP-Listen und User-Agent-Strings.
  • Schema Markup als JSON-LD-Graph: Organization, Person, Service, FAQ und DefinedTerm, über @id verknüpft statt als isolierte Blöcke.
  • llms.txt nach dem Format von llmstxt.org, abgestimmt auf deine wichtigsten Seiten.
  • Nachtest-Protokoll nach der Umsetzung.

Muster: Auszug aus einem Prüfprotokoll

So dokumentieren wir den Crawler-Check. Muster, keine echten Kundendaten.

User-Agentrobots.txtAntwortInhalt im HTMLBefund
Browser (Referenz)–200vollständigReferenz
OAI-SearchBoterlaubt403–Bot-Schutz im CDN blockiert, Regel nötig
PerplexityBoterlaubt200nur Navigation, Leistungstext fehltText wird clientseitig nachgeladen
GPTBotgesperrt––bewusste Entscheidung, bleibt so
Googleboterlaubt200vollständig nach Renderingok, Server-Auslieferung trotzdem empfohlen

Einen ersten Schnelltest kannst du selbst machen: Unter Werkzeuge findest du einen Crawler-Check und einen llms.txt-Generator.

llms.txt umsetzen – mit realistischer Erwartung

Die llms.txt ist ein Vorschlag von Jeremy Howard aus dem Jahr 2024: eine Markdown-Datei, in der eine H1 mit dem Namen der Website Pflicht ist, danach optional eine Kurzbeschreibung und Linklisten zu den wichtigsten Seiten. Wir schreiben sie so, dass sie auf die Seiten verweist, die eine Frage vollständig beantworten, nicht auf alles.

Ehrlich: Es gibt keinen Beleg dafür, dass die Datei die Sichtbarkeit erhöht. Google schreibt in seiner Dokumentation zu AI Overviews und AI Mode, dass du dafür keine neuen maschinenlesbaren Dateien, keine KI-Textdateien und kein spezielles Markup brauchst. Von den anderen Anbietern gibt es keine dokumentierte Zusage. Wir legen sie trotzdem an, weil sie wenig kostet und nicht schadet. Als Maßnahme mit erwartbarer Wirkung verkaufen wir sie nicht.

Schema Markup: wofür es gut ist und wofür nicht

Dieselbe Google-Seite sagt auch: Für AI Overviews gibt es kein spezielles schema.org-Markup, das du ergänzen musst. Warum wir strukturierte Daten trotzdem sorgfältig bauen: Sie sagen eindeutig, wer hinter der Website steht, welche Leistungen angeboten werden und wer welchen Text verantwortet. Diese Zuordnung von Entitäten ist der Teil, den wir für KI-Systeme für relevant halten, nicht das Sternchen im Suchergebnis. Deshalb ein verknüpfter Graph statt einzelner Snippets aus einem Plugin.

Passt, wenn …

  • du in KI-Antworten fehlst, obwohl deine Inhalte gut sind
  • deine Website hinter einem CDN oder einer Firewall mit Bot-Schutz läuft
  • Inhalte per Framework clientseitig gerendert werden
  • niemand weiß, wer wann die robots.txt geändert hat
  • du Training und Suche bewusst getrennt steuern willst

Eher nicht, wenn …

  • deine Website zu deinen Themen noch keine Inhalte hat – dann zuerst Inhalte
  • du nur eine llms.txt brauchst, die kannst du mit unserem Generator selbst erstellen
  • du einen kompletten Relaunch suchst; den übernehmen wir nicht

Was wir von dir brauchen

  • Für den Check: nur die öffentliche Website. Logs aus Server oder CDN machen ihn deutlich genauer.
  • Für die Umsetzung: Zugang zum CMS, zur Search Console und zu den Firewall- oder CDN-Einstellungen, alternativ eine Ansprechperson bei Entwicklung oder Hoster.
  • Deine Entscheidung, ob Trainings-Crawler Zugriff haben sollen.

Was die Technik nicht leistet

Technik öffnet die Tür, sie sorgt nicht dafür, dass jemand hereinkommt. Eine perfekt erreichbare Seite ohne zitierfähigen Inhalt wird nicht genannt. Und robots.txt ist laut Standard RFC 9309 keine Zugriffskontrolle: Seriöse Crawler halten sich daran, erzwingen lässt sich damit nichts. Wer Bots wirklich aussperren will, braucht Regeln in Firewall oder Server. Auch nach der Umsetzung gilt: keine Garantie auf Nennung, und eine Veränderung bewerten wir erst über mindestens drei Messungen.

Aufwand und Kosten

Der Technik-Check ist Teil des GEO-Audits (1.900–3.400 € netto, 2–3 Wochen, Festpreis). Die Umsetzung gehört zur Aufbauphase (5.000–20.000 € netto, 4–8 Wochen); wie viel davon auf Technik entfällt, hängt davon ab, wie viel zu tun ist. Die monatliche Kontrolle läuft in der Betreuung ab 1.500 € im Monat netto mit. Details auf der Seite Preise.

Verwandte Begriffe

KI-Crawler · robots.txt · KI-Crawler blockieren · Bot-Management · JSON-LD · schema.org · DefinedTerm · HTTP-Statuscode

Weiterlesen

Quellen

Stand: September 2026

Häufige Fragen

Soll ich KI-Crawler blockieren?

Das ist eine Abwägung. Trainings-Crawler kann man sperren, wenn man das will. Such- und Abruf-Crawler zu sperren heißt, auf Nennungen zu verzichten. Die pauschale Sperre aller Bots mit KI im Namen ist fast immer die falsche Entscheidung.

Woher weiß ich, ob mich KI-Crawler erreichen?

Aus dem Server- oder CDN-Log, gefiltert nach den User-Agent-Strings und abgeglichen mit den veröffentlichten IP-Listen. Zusätzlich rufen wir die Seite mit gesetztem Bot-String ab und vergleichen die Antworten mit einem normalen Browser-Abruf.

Brauche ich Schema Markup wirklich?

Für Rich Results nur bei bestimmten Typen, und Google verlangt für AI Overviews kein spezielles Markup. Für die eindeutige Zuordnung von Organisation, Leistungen und Urheberschaft halten wir einen sauberen JSON-LD-Graphen trotzdem für sinnvoll.

Bringt eine llms.txt etwas?

Belegt ist das nicht. Google sagt ausdrücklich, dass keine KI-Textdateien nötig sind, andere Anbieter haben sich nicht festgelegt. Wir legen sie an, weil sie wenig kostet, versprechen aber keine Wirkung.

Mein Framework rendert im Browser – muss ich neu bauen?

Meist nicht. Oft reicht serverseitiges Rendering oder Pre-Rendering für die Seiten, die zitiert werden sollen. Wir zeigen dir, welche Seiten betroffen sind, und klären die Umsetzung mit deiner Entwicklung.

Warum reicht es nicht, die robots.txt freizugeben?

Weil die robots.txt nur eine Bitte an Crawler ist. Ob eine Anfrage durchkommt, entscheiden Firewall, CDN und Server. Genau dort liegen die meisten Blockaden, die wir finden.

Macht ihr die Umsetzung selbst?

Wenn du uns Zugang gibst, ja. Andernfalls bekommt deine Entwicklung oder dein Hoster eine konkrete Anleitung, und wir testen danach nach.

Passt das zu dir?

30 Minuten, kostenlos, mit einer ehrlichen Einschätzung — auch dann, wenn die Antwort lautet, dass sich das für dich gerade nicht lohnt.

Erstgespräch vereinbarenPreise ansehen

Nach oben scrollen