deine-geo-agentur.de

KI-Technik

Retrieval

Von Felix Wilhelm · geprüft am 22. September 2026

Kurz gesagt: Retrieval ist der Abrufschritt, in dem ein Such- oder KI-System zu einer Anfrage passende Dokumente oder Textpassagen aus einem Index holt, bevor sortiert und eine Antwort formuliert wird.

Definition: Retrieval

Retrieval (englisch für „Abruf“) stammt aus dem Information Retrieval, dem Teilgebiet der Informatik, das sich mit dem Wiederfinden gespeicherter Informationen beschäftigt. In KI-Suchsystemen ist Retrieval die erste Stufe einer Kette: Abruf der Kandidaten, danach Reranking, danach die Generierung. Bekannt wurde das Zusammenspiel durch die RAG-Arbeit von Lewis et al. (2020). Abzugrenzen ist Retrieval vom Grounding: Retrieval beschafft das Material, Grounding bezeichnet, dass die fertige Antwort auf diesem Material fußt.

Auch genannt:AbrufInformation RetrievalDokumentenabruf

Was du dazu wissen solltest

Es gibt zwei Grundverfahren. Das lexikalische Retrieval sucht nach übereinstimmenden Wörtern und gewichtet sie nach Häufigkeit und Seltenheit. Das dichte Retrieval übersetzt Anfrage und Text in Embeddings und sucht die Passagen, deren Vektoren am nächsten beieinanderliegen; Karpukhin et al. haben 2020 gezeigt, dass dieses Verfahren bei offenen Wissensfragen gut funktioniert. Viele Systeme kombinieren beide Wege. Abgerufen werden dabei selten ganze Seiten, sondern Abschnitte, die vorher in Stücke zerlegt wurden (siehe Chunking).

Google beschreibt den Ablauf für AI Overviews und AI Mode offen: Die Systeme stützen sich auf die Kern-Rankingsysteme der Suche, um relevante, aktuelle Seiten aus dem Suchindex abzurufen, und erzeugen daraus die Antwort. Zusätzlich formuliert das Modell per Query Fan-Out mehrere verwandte Teilanfragen, die jeweils einen eigenen Abruf auslösen. Daraus folgt die wichtigste Regel für KI-Sichtbarkeit: Was nicht abgerufen wird, kann nicht zitiert werden. Eine Seite, die nicht im Index steht, hinter einem Login liegt oder Crawler aussperrt, fällt schon an dieser Stelle heraus.

Ein verbreiteter Irrtum lautet, das Modell „kenne“ eine Website. Zu unterscheiden ist parametrisches Wissen aus dem Training vom Wissen, das im Moment der Frage per Retrieval hinzukommt. Nur Letzteres lässt sich kurzfristig beeinflussen. Außerdem nutzt nicht jedes System denselben Index: Google greift auf den eigenen Suchindex zu, andere Anbieter auf eigene Crawls oder den Index eines Partners. Wer nur bei Google gut auffindbar ist, ist deshalb nicht automatisch für jede KI-Suche abrufbar.

Konkret prüfst du drei Dinge. Erstens den Zugang: Lässt deine robots.txt die relevanten Bots zu? Das zeigt der KI-Crawler-Check. Zweitens die Form: Stehen Kerninformationen im HTML oder nur in PDFs, Bildern und Skripten? Drittens die Suchbegriffe der Maschine: Bing Webmaster Tools weist seit Februar 2026 im Bericht „AI Performance“ sogenannte Grounding Queries aus, also Stichproben der Suchphrasen, mit denen die KI beim Abruf gesucht hat. Diese Phrasen unterscheiden sich oft von der ursprünglichen Nutzerfrage und zeigen, wonach dein Inhalt tatsächlich gefunden werden muss. Die technische Seite dieser Prüfung gehört zur GEO-Technik.

Ein Beispiel aus der Praxis

Praxisbeispiel

Ein Hersteller von Industriepumpen stellt technische Daten nur in einem Konfigurator bereit, der per JavaScript nachlädt, und in PDF-Datenblättern. Auf die Frage nach Pumpen für abrasive Medien nennen KI-Systeme ausschließlich Wettbewerber. Das Team überträgt Förderleistung, Werkstoffe und Einsatzgrenzen in eine HTML-Seite je Baureihe. Ob die Marke danach genannt wird, ist offen, aber die Inhalte sind jetzt überhaupt abrufbar.

Wie wir das bei Kunden umsetzen, steht hier: Technik für KI-Sichtbarkeit: Crawler, Schema, llms.txt →

Retrieval: typische Fragen

Was ist der Unterschied zwischen Retrieval und Ranking?

Retrieval sammelt aus einem großen Index eine Kandidatenmenge, die zur Anfrage passen könnte. Ranking beziehungsweise Reranking bringt diese Kandidaten danach in eine Reihenfolge. Eine Seite, die im Retrieval nicht auftaucht, bekommt keine Chance im Ranking, egal wie gut sie wäre.

Nutzt ChatGPT bei jeder Antwort Retrieval?

Nein. ChatGPT sucht nur dann im Web, wenn die Suche aktiviert ist oder das System entscheidet, dass eine Frage aktuelle Informationen braucht. Sonst antwortet das Modell aus seinem Trainingswissen. Deshalb können zwei ähnliche Fragen einmal mit Quellenlinks und einmal ohne beantwortet werden.

Kann ich sehen, ob meine Seiten abgerufen werden?

Teilweise. Server-Logs zeigen Zugriffe von Bots wie OAI-SearchBot oder PerplexityBot. Bing Webmaster Tools listet Zitierungen und Grounding Queries für Copilot, die Search Console zeigt Impressionen in AI Overviews und AI Mode. Einen vollständigen Abrufbericht aller Systeme gibt es nicht.

Das hängt damit zusammen

Quellen: Lewis et al., Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (2020) (Stand September 2026) · Karpukhin et al., Dense Passage Retrieval for Open-Domain Question Answering (2020) (Stand September 2026) · Google Search Central: Optimizing your website for generative AI features on Google Search (Stand September 2026)

Wo Anbieter einen Begriff unterschiedlich verwenden, nennen wir beide Lesarten. Einen Fehler gefunden? Schreib uns, wir korrigieren ihn. Zurück zum Glossar

Reden wir 30 Minuten darüber

Kostenlos, unverbindlich und mit einer ehrlichen Einschätzung, ob sich GEO bei dir gerade lohnt.

Erstgespräch vereinbaren+49 174 164 5727

Nach oben scrollen