KI-Technik
RAG (Retrieval Augmented Generation)
Kurz gesagt: RAG ist die Architektur, bei der ein System vor der Antwort passende Dokumente sucht und sie dem Sprachmodell mitgibt, statt es allein aus seinem Trainingswissen antworten zu lassen.
Was ist mit RAG (Retrieval Augmented Generation) gemeint?
Retrieval Augmented Generation verbindet eine Suchkomponente mit einem Sprachmodell. Der Begriff stammt aus einer Arbeit von Patrick Lewis und Kollegen, im Mai 2020 veröffentlicht und auf der NeurIPS 2020 vorgestellt. Sie kombinierte das im Modell gespeicherte Wissen mit einem durchsuchbaren Vektorindex der Wikipedia. Google nennt RAG in seiner Doku als Technik hinter AI Overviews und AI Mode. Grounding bezeichnet das Ziel, Aussagen an Quellen zu binden; RAG ist die Architektur, die das umsetzt.
Was du dazu wissen solltest
Der Ablauf hat vier Schritte. Zuerst wird die Nutzerfrage in eine oder mehrere Suchanfragen übersetzt. Dann liefert das Retrieval passende Textausschnitte aus einem Index, klassisch über Stichwörter, meist zusätzlich über Vektorähnlichkeit. Ein Reranking sortiert die Kandidaten nach Relevanz. Schließlich bekommt das Modell die besten Ausschnitte zusammen mit der Frage in sein Kontextfenster und formuliert daraus die Antwort. Lewis et al. nannten das Zusammenspiel von parametrischem Gedächtnis im Modell und nicht-parametrischem Gedächtnis im Index.
Aus der Architektur ergeben sich die Ansatzpunkte. Die Suchkomponente findet nur, was im Index steht, also crawlbar und indexierbar ist. Sie wählt Ausschnitte aus, nicht ganze Seiten, also entscheidet die Qualität einzelner Passagen. Und das Modell bevorzugt Passagen, die zur Frage passen und für sich verständlich sind. Für Google bestätigt der Leitfaden vom Mai 2026 genau das: Die Kernsysteme der Suche holen relevante, aktuelle Seiten, erst dann entsteht die Antwort.
Ein oft übersehener Punkt ist die Abschnittsgrenze. Viele RAG-Systeme zerlegen Dokumente vor dem Indexieren in Abschnitte, das sogenannte Chunking. Eine Aussage, die sich über eine Kapitelgrenze hinweg aufbaut, kann dabei zerrissen werden. Google betont zwar, dass du für die eigene Suche nichts zerstückeln musst. Für Systeme, deren Zerlegung du nicht kennst, bleibt die robuste Regel: Zahl, Bezug und Einschränkung gehören in denselben Absatz.
Warum zitiert ein RAG-System nicht immer die beste Seite? Weil jede Stufe filtert. Eine Seite, die der Crawler nicht erreicht, fehlt im Index. Eine Seite, deren Kernaussage in einem Bild steckt, liefert keinen passenden Textausschnitt. Und eine Passage, die erst nach drei Sätzen Einleitung zur Sache kommt, verliert beim Reranking gegen eine, die direkt antwortet. Wer seine Seiten durch diese Stufen denkt, findet die Schwachstelle meist schnell; die Grundlage dafür ist saubere Indexierung.
Ein Beispiel aus der Praxis
Ein Nutzer fragt nach aktuellen Fördersätzen für die Dämmung eines Altbaus. Das System sucht, findet vier Dokumente, übergibt daraus je zwei Absätze an das Modell und lässt eine Antwort formulieren. Zitiert wird die Seite einer Energieagentur, deren Absatz Fördersatz, Bezugsjahr und Bedingung in zwei Sätzen enthält, nicht die längere Seite, die dieselbe Information über drei Kapitel verteilt.
Die passende Leistung dazu: Technik für KI-Sichtbarkeit: Crawler, Schema, llms.txt →
Fragen, die dazu oft kommen
Muss ich meine Inhalte für RAG anders strukturieren?
Kaum anders als für gute Leser. Klar überschriebene Abschnitte, in denen Zahl, Bezug und Einschränkung zusammenstehen, überstehen jede Zerlegung besser. Künstliches Zerstückeln ist laut Google für die Google-Suche nicht nötig und schadet oft der Lesbarkeit.
Ist RAG dasselbe wie eine Websuche?
Nein. Die Websuche kann die Retrieval-Stufe sein, RAG beschreibt aber das ganze Muster aus Abruf und anschließender Generierung. Der Index kann das offene Web sein, ein Firmenwiki oder eine Produktdatenbank.
Was ist der Unterschied zwischen RAG und Fine-Tuning?
Fine-Tuning verändert die Gewichte eines Modells durch zusätzliches Training. RAG lässt das Modell unverändert und gibt ihm bei jeder Frage passende Dokumente mit. Für aktuelle Informationen ist RAG der schnellere Weg, weil ein neues Dokument sofort abrufbar ist.
Warum taucht meine Seite trotz guten Rankings nicht in RAG-Antworten auf?
Weil Ranking nur eine Stufe ist. Die Passage muss auch zur konkreten Teilfrage passen, beim Reranking bestehen und im Kontextfenster Platz finden. Häufige Ursachen sind lange Einleitungen, Kernaussagen in Bildern oder PDFs und Zahlen ohne erkennbaren Bezug.
Das hängt damit zusammen
Quellen: Lewis et al.: Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks (arXiv 2005.11401, NeurIPS 2020) (Stand September 2026) · Google Search Central: Optimizing your website for generative AI features on Google Search (Stand September 2026) · Karpukhin et al.: Dense Passage Retrieval for Open-Domain Question Answering (arXiv 2004.04906) (Stand September 2026)
Wo Anbieter einen Begriff unterschiedlich verwenden, nennen wir beide Lesarten. Einen Fehler gefunden? Schreib uns, wir korrigieren ihn. Zurück zum Glossar
Wirst du in KI-Antworten genannt?30 Minuten, kostenlos, mit ehrlicher Einschätzung.
Reden wir 30 Minuten darüber
Kostenlos, unverbindlich und mit einer ehrlichen Einschätzung, ob sich GEO bei dir gerade lohnt.