deine-geo-agentur.de

KI-Technik

Chunking

Von Felix Wilhelm · geprüft am 22. September 2026

Kurz gesagt: Chunking ist das Zerlegen von Dokumenten in kleinere Textabschnitte, damit ein KI-System sie einzeln als Embedding speichern, durchsuchen und dem Sprachmodell als passende Belegstelle übergeben kann.

Was ist mit Chunking gemeint?

In Retrieval-Systemen werden Texte vor der Indexierung in Chunks geteilt, typischerweise nach Länge, nach Absätzen oder entlang von Überschriften. Anthropic nennt als übliche Größe höchstens einige hundert Token pro Abschnitt. Jeder Chunk erhält ein eigenes Embedding und wird unabhängig vom restlichen Dokument gefunden. Abzugrenzen ist Chunking vom Passage Ranking bei Google, das einzelne Abschnitte einer Seite für das Ranking bewertet, die Seite aber als Ganzes im Index behält.

Auch genannt:Text-ChunkingSegmentierungDocument ChunkingPassagenbildung

Was du dazu wissen solltest

Das Kernproblem des Chunkings hat Anthropic 2024 an einem Beispiel gezeigt: Ein Abschnitt lautet „Der Umsatz des Unternehmens wuchs gegenüber dem Vorquartal um 3 Prozent.“ Isoliert fehlt alles Wesentliche, nämlich welches Unternehmen und welches Quartal. Wird der Chunk ohne diesen Kontext gespeichert, findet ihn die Suche nicht oder ordnet ihn falsch zu. Anthropic schlug deshalb vor, jedem Chunk vor dem Einbetten eine kurze Kontextzeile voranzustellen, und berichtete in eigenen Tests von 35 Prozent weniger Fehltreffern, in Kombination mit Stichwortsuche und Reranking von 67 Prozent.

Du hast keinen Einfluss darauf, wie ein fremdes System deine Seite zerteilt. Du kannst aber die Wahrscheinlichkeit erhöhen, dass jeder Abschnitt für sich verständlich bleibt. Das gelingt, wenn wichtige Absätze ihren Gegenstand selbst benennen, statt auf „wie oben beschrieben“ oder „dieses Produkt“ zu verweisen. Eine saubere Gliederung mit sprechenden Zwischenüberschriften hilft zusätzlich, weil viele Verfahren an Überschriften trennen.

Hier liegt ein Missverständnis, das Google ausdrücklich anspricht. In seinem Leitfaden zu generativen Suchfunktionen schreibt Google, es sei nicht nötig, Inhalte für KI in winzige Stücke zu zerlegen. Das ist kein Widerspruch zu den obigen Regeln. Gemeint ist: Keine Fragmentierung in Stichpunktlisten und Mini-Absätze, nur weil man Chunking vermutet. Gefragt sind vollständige Absätze, die ihre Aussage in sich tragen, nicht kurze Häppchen ohne Zusammenhang.

Ein zweiter Irrtum betrifft die Länge. Ein langer Artikel ist kein Nachteil, solange jeder Abschnitt einen klaren Fokus hat. Problematisch sind Absätze, die mehrere Themen vermischen, denn dann enthält ein Chunk halbe Aussagen zu zwei Fragen und passt zu keiner gut.

Praktische Prüfung: Kopiere einen beliebigen Absatz deiner wichtigsten Seite in ein leeres Dokument. Versteht jemand ohne den Rest der Seite, worum es geht, wer gemeint ist und welche Zahl wofür gilt? Wenn nicht, ergänze Subjekt, Bezug und Einheit. Das ist die gleiche Logik, auf der RAG-Systeme und die Antwortzone aufbauen.

An einem Fall erklärt

Praxisbeispiel

Ein Steuerberater erklärt auf einer Seite die Abschreibung von Photovoltaikanlagen. Ein Absatz beginnt mit „Hier gilt seit 2022 eine Sonderregel“. Als Chunk gelesen fehlt der Bezug. Nach der Überarbeitung lautet der Satz: „Für private Photovoltaikanlagen bis 30 kWp gilt seit 2022 eine Steuerbefreiung nach § 3 Nr. 72 EStG.“ Der Absatz ist nun auch isoliert eindeutig.

Wie wir das bei Kunden umsetzen, steht hier: Technik für KI-Sichtbarkeit: Crawler, Schema, llms.txt →

Chunking: typische Fragen

Wie groß ist ein Chunk?

Das legt jedes System selbst fest. Üblich sind Abschnitte von einigen hundert Token, oft mit leichter Überlappung zwischen benachbarten Chunks. Manche Verfahren trennen nach fester Länge, andere entlang von Absätzen und Überschriften. Von außen lässt sich die genaue Größe nicht bestimmen.

Muss ich meine Texte für Chunking kürzer schreiben?

Nein. Google sagt ausdrücklich, dass Inhalte nicht in kleine Stücke zerlegt werden müssen. Entscheidend ist, dass jeder Absatz ein Thema hat und seinen Bezug selbst nennt. Ein langer Text mit klar gegliederten Abschnitten funktioniert besser als viele Fragmente.

Was ist Contextual Retrieval?

Contextual Retrieval ist ein 2024 von Anthropic beschriebenes Verfahren, bei dem jedem Chunk vor dem Einbetten eine kurze Erklärung seines Zusammenhangs im Dokument vorangestellt wird. So bleibt erkennbar, auf welches Unternehmen oder welchen Zeitraum sich ein Abschnitt bezieht.

Begriffe im Umfeld

Quellen: Anthropic: Introducing Contextual Retrieval (September 2024) (Stand September 2026) · Google Search Central: Optimizing for generative AI features (Stand September 2026)

Definitionen im Glossar sind redaktionell geprüft, ersetzen aber keine Beratung für deinen Einzelfall. Zurück zum Glossar

Reden wir 30 Minuten darüber

Kostenlos, unverbindlich und mit einer ehrlichen Einschätzung, ob sich GEO bei dir gerade lohnt.

Erstgespräch vereinbaren+49 174 164 5727

Nach oben scrollen