deine-geo-agentur.de

Messung

KI-Sichtbarkeit messen: Methode, Kennzahlen und Vorlage (2026)

KI-Sichtbarkeit messen mit Methode: Prompt-Set bauen, Streuung beherrschen, Kennzahlen berechnen und neue Daten aus Search Console, GA4 und Bing nutzen.

Von Felix Wilhelm · veröffentlicht am 22. September 2026 · fachlich geprüft am 22. September 2026 · 9 Min. Lesezeit

Mann prüft am Schreibtisch eine Tabelle mit Messwerten auf einem großen Bildschirm

Kurz gesagt: KI-Sichtbarkeit misst du auf zwei Wegen: mit offiziellen Daten, wo es sie gibt (Search Console für AI Overviews und AI Mode, Bing Webmaster Tools für Copilot, GA4 für Klicks aus KI-Assistenten), und mit einem festen Prompt-Set, das du regelmäßig in mehreren Läufen über ChatGPT, Perplexity, Gemini und weitere Systeme abfragst. Es zählen Raten über viele Antworten, nicht einzelne Screenshots.

Seit 2026 liefern Google, Microsoft und GA4 erstmals offizielle Zahlen zur KI-Suche. Für ChatGPT und Perplexity bleibt die Prompt-Messung trotzdem der einzige Weg. Nach diesem Beitrag kannst du ein Prompt-Set aufbauen, die Kennzahlen korrekt berechnen und beurteilen, ob sich deine Sichtbarkeit wirklich verändert hat.

Was bedeutet KI-Sichtbarkeit, und was davon ist messbar?

KI-Sichtbarkeit beschreibt, wie oft und wie prominent dein Unternehmen in den Antworten von KI-Systemen vorkommt. Messbar ist sie auf drei Ebenen, die jeweils eigene Datenquellen und eigene Grenzen haben.

Wer nur eine Ebene betrachtet, zieht falsche Schlüsse: Nennungen ohne Link erzeugen keinen messbaren Traffic, einzelne Klicks belegen keine breite Sichtbarkeit. Einen branchenweiten Standardwert wie den Sichtbarkeitsindex im klassischen SEO gibt es für AI Visibility nicht.

Ebene Frage Datenquelle Grenze
Nennung Kommt mein Name in der Antwort vor? Eigenes Prompt-Monitoring Stichprobe, schwankt von Lauf zu Lauf
Zitation Wird meine Seite als Quelle angezeigt? Search Console (Google), Bing Webmaster Tools (Copilot), Prompt-Monitoring Offizielle Daten nur für Google und Microsoft
Wirkung Kommen Besucher und Anfragen? GA4-Kanal AI Assistant, Markensuchen, Herkunftsfrage im Formular Viele KI-Nutzer klicken nicht; Klicks ohne Referrer landen unter Direct

Welche offiziellen Datenquellen gibt es 2026?

2026 sind drei offizielle Quellen dazugekommen: der KI-Bericht der Search Console, AI Performance in den Bing Webmaster Tools und der GA4-Kanal AI Assistant. Sichtbarkeit in ChatGPT, Perplexity oder Claude zeigt keine davon.

Search Console: Generative-AI-Leistungsbericht

Google hat den Bericht am 3. Juni 2026 vorgestellt und ihn laut Nachtrag am 31. August 2026 für alle Websites weltweit freigegeben. Er zeigt Impressionen in AI Overviews und AI Mode nach Seiten, Ländern, Geräten und Datum, bis auf Stundenebene; Discover hat einen eigenen Bericht. Eine Impression zählt, wenn ein Link zu deiner Website in einer KI-Funktion angezeigt wurde. Suchanfragen und Klicks weist der Bericht nicht aus.

Fehlt der Bericht, hat deine Website laut Google zu wenige KI-Impressionen oder ist unter Einstellungen, „Search generative AI“, aus den KI-Funktionen ausgeschlossen. Für DACH-Unternehmen nützlich: Über die Länder-Dimension trennst du Deutschland, Österreich und die Schweiz sauber. Mehr zum Werkzeug steht im Verzeichniseintrag Google Search Console.

Bing Webmaster Tools: AI Performance

Microsoft hat AI Performance am 10. Februar 2026 als öffentliche Vorschau gestartet. Er zählt, wie oft deine Seiten als Quelle in Copilot, in Bings KI-Zusammenfassungen und bei ausgewählten Partnern erschienen, je URL und im Zeitverlauf, dazu eine Stichprobe der Grounding Queries: der Suchbegriffe, mit denen die KI nach Quellen gesucht hat. Seit dem 16. Juni 2026 kommen Intents, Themencluster, ein Citation Share (dein Anteil an allen Zitationen zu einer Grounding Query) und ein Zeitraumvergleich hinzu. Einrichtung und Funktionsumfang beschreibt der Eintrag Bing Webmaster Tools.

GA4: Kanal „AI Assistant“

Google Analytics 4 führt seit Mai 2026 einen Standardkanal „AI Assistant“. Laut Analytics-Hilfe umfasst er Besuche aus Quellen wie ChatGPT, Gemini, Deepseek, Copilot oder Grok. Klicks aus AI Overviews und AI Mode zählen ausdrücklich nicht dazu, sie laufen unter Organic Search. Eine vollständige Liste der erkannten Quellen hat Google nicht veröffentlicht. Für ChatGPT gibt es eine zweite Spur: OpenAI hängt laut Publisher-FAQ an Links aus der ChatGPT-Suche automatisch utm_source=chatgpt.com an. Was den Kanal verzerrt, erklärt der Glossarbeitrag KI-Referral-Traffic. Für eine eigene Kanalgruppe eignet sich ein regulärer Ausdruck auf die Sitzungsquelle:

chatgpt|openai|perplexity|gemini\.google|copilot\.microsoft|claude\.ai|deepseek|grok

Wie baust du ein Prompt-Set, das trägt?

Ein gutes Prompt-Set besteht aus 20 bis 40 Fragen, die echte Kunden in echter Sprache stellen, verteilt auf fünf Kategorien. Es bleibt über Monate unverändert, damit eine Zeitreihe entsteht.

Ich baue jedes Prompt-Set aus Vertriebsgesprächen und Kundenanfragen, nicht aus Keyword-Tools, denn in KI-Chats schreiben Menschen ganze Sätze mit Kontext. Angenommen, ein Hersteller von Industriekühlanlagen aus Baden-Württemberg misst seine Sichtbarkeit. Ein Set könnte so beginnen:

Kategorie Anteil Beispiel-Prompt
Anbieterfrage 30 % Welche Hersteller für industrielle Kühlanlagen gibt es in Süddeutschland?
Problemfrage 25 % Unsere Kältemaschine fällt im Sommer regelmäßig aus. Was sind die Ursachen, und wer kann das lösen?
Vergleichsfrage 20 % Was ist besser für eine Brauerei mit 50.000 Hektolitern: Glykolkühlung oder Direktverdampfung? Nenne Anbieter.
Kaufnahe Frage 15 % Was kostet eine Kälteanlage für eine Lagerhalle mit 2.000 Quadratmetern, und welche Firmen bieten das an?
Markenfrage 10 % Was weißt du über [Firmenname] aus [Ort]? Ist das Unternehmen seriös?

Drei Regeln machen das Set belastbar. Erstens: Formuliere Varianten. In der SparkToro-Studie vom Januar 2026 lag die semantische Ähnlichkeit menschlicher Prompts zur selben Absicht bei nur 0,081. Zu jeder Kernfrage gehören daher zwei bis drei Formulierungen. Zweitens: Schreib auf Deutsch und mit Ortsbezug, wenn deine Kunden das tun; „in der Schweiz“ liefert andere Anbieter als ein Prompt ohne Ort. Drittens: Nenne in Anbieter- und Problemfragen nie deinen eigenen Namen. Sonst misst du Bekanntheit, nicht Empfehlung.

Welche Systeme, wie viele Läufe?

Miss mindestens ChatGPT, Perplexity, Gemini und Google mit AI Overviews und AI Mode, im B2B zusätzlich Copilot und Claude. Frage jeden Prompt pro System mindestens dreimal ab, in einem frischen Chat ohne Verlauf.

Wiederholung ist Pflicht, weil Sprachmodelle nicht deterministisch antworten: SparkToro und Gumshoe.ai werteten mit 600 Freiwilligen 2.961 Abfragen in ChatGPT, Claude und Google AI Overviews aus (veröffentlicht am 28. Januar 2026). Die Chance, dass ChatGPT oder Googles KI bei 100 Wiederholungen dieselbe Liste liefert, lag unter eins zu hundert, für dieselbe Reihenfolge unter eins zu tausend. Stabil war dagegen, welche Marken überhaupt häufig vorkamen. Nennungsraten über viele Läufe sind also aussagekräftig, einzelne Antworten nicht.

  • Jede Abfrage in einem neuen Chat, Gedächtnis- und Personalisierungsfunktionen aus.
  • Gleicher Modus je System dokumentiert (mit oder ohne Websuche, welches Modell).
  • Sprache und Standort fest: Deutsch, Land des Zielmarkts.
  • Jede Antwort als Screenshot oder Text mit Zeitstempel gesichert.
  • Prompt-Set eingefroren; neue Fragen bilden ein zweites Set mit eigenem Startwert.

Welche Kennzahlen zählen?

Fünf Kennzahlen reichen: Nennungsrate, Zitationsrate, Share of Voice, zitierte Quellen und Tonalität. Die Position ist nur eingeschränkt brauchbar.

Kennzahl Formel Wofür
Nennungsrate Antworten mit Nennung ÷ alle Antworten Hauptkennzahl, je System und gesamt
Zitationsrate Antworten mit Link auf deine Domain ÷ alle Antworten Zeigt, ob du als abrufbare Quelle dienst
Share of Voice Eigene Nennungen ÷ Nennungen aller beobachteten Marken Stand gegenüber den Wettbewerbern
Quellenanteile Häufigkeit je zitierter Domain Zeigt, welche Drittseiten die Antworten prägen
Tonalität Anteil positiv, neutral, negativ, falsch Findet Falschaussagen und Vorbehalte
Position (optional) Nennung im ersten Drittel der Antwort ja/nein Grobe Prominenz, nicht als Rang lesen

Zur Position gibt es zwei Lager. Die GEO-Forschung von Aggarwal et al. gewichtet Nennungen nach ihrer Stellung im Text. SparkToro hält Rangplätze in KI-Antworten für wertlos, weil die Reihenfolge fast bei jeder Abfrage wechselt. Ich erfasse deshalb nur grob, ob die Nennung im ersten Drittel steht, und werte das nie ohne Nennungsrate aus. Wer die Tonalität systematisch erfasst, findet auch Halluzinationen über das eigene Unternehmen, bevor Kunden sie finden.

Rechenbeispiel: Wann ist eine Veränderung echt?

Echt ist eine Veränderung erst, wenn sie größer ist als die Streuung deiner Stichprobe, bei typischen Setgrößen also mehrere Prozentpunkte.

Angenommen, du fragst 30 Prompts in vier Systemen mit je drei Läufen ab. Das ergibt 30 × 4 × 3 = 360 Antworten.

  • Deine Marke wird in 90 Antworten genannt: Nennungsrate 90 ÷ 360 = 25 Prozent.
  • In 36 Antworten ist deine Domain verlinkt: Zitationsrate 10 Prozent.
  • Wettbewerber A kommt auf 150 Nennungen, B auf 120, C auf 60. Share of Voice: 90 ÷ (90 + 150 + 120 + 60) = 90 ÷ 420 = 21,4 Prozent.

Der Standardfehler eines Anteils ist √(p × (1 − p) ÷ n), hier √(0,25 × 0,75 ÷ 360) ≈ 0,023. Das 95-Prozent-Intervall reicht damit von etwa 20,5 bis 29,5 Prozent. Steigt die Nennungsrate im Folgemonat auf 28 Prozent, ist das kein belegter Fortschritt. Betrachtest du nur ein System mit 90 Antworten, wächst die Unsicherheit auf rund ±9 Prozentpunkte. Und das ist optimistisch, weil drei Läufe desselben Prompts nicht unabhängig sind. Deshalb berichte ich Trends erst über drei Messungen und nie aus einem einzelnen System heraus.

Protokollvorlage für den Messlauf

Ein Messprotokoll hält jede Antwort in einer Zeile fest, damit jede Kennzahl nachvollziehbar bleibt.

Spalte Inhalt Beispiel
Datum, Uhrzeit Zeitpunkt der Abfrage 01.10.2026, 09:14
System, Modus Anbieter, Modell, Websuche an/aus ChatGPT, Websuche an
Prompt-ID, Lauf Kennung aus dem Set, Lauf 1–3 A-04, Lauf 2
Genannt ja/nein ja
Eigene URL verlinkt URL oder leer /leistungen/kaelteanlagen/
Wettbewerber alle genannten Marken Firma A; Firma B
Zitierte Quellen Domains der Belege fachportal.de; verband.de
Tonalität positiv, neutral, negativ, falsch neutral
Beleg Link zu Screenshot oder Text Ordner/2026-10/A-04-2.png

So läuft ein Monat bei mir ab:

  1. 1

    Offizielle Daten ziehen

    30 Minuten

    Search-Console-KI-Bericht, Bing AI Performance mit Grounding Queries und GA4-Kanal AI Assistant exportieren.

  2. 2

    Prompt-Läufe durchführen

    4–8 Stunden manuell

    Alle Prompts je System dreimal abfragen und jede Antwort ins Protokoll übertragen.

  3. 3

    Kennzahlen berechnen

    1 Stunde

    Nennungsrate, Zitationsrate und Share of Voice je System und gesamt, dazu die zehn häufigsten zitierten Domains.

  4. 4

    Gegen Streuung prüfen

    30 Minuten

    Nur Veränderungen außerhalb des Intervalls und über mehrere Messungen als Trend werten.

  5. 5

    Falschaussagen und Quellen auswerten

    1 Stunde

    Neue Fehler samt Herkunft dokumentieren. Neue Quellen sind Kandidaten für eigene Erwähnungen.

Wer diese Arbeit nicht intern leisten kann, bekommt sie als monatliches Prompt-Monitoring mit Rohdaten.

Tools einordnen: was sie leisten und was nicht

Prompt-Monitoring-Tools automatisieren die Abfragen und das Zählen. Die Tools ersetzen weder die offiziellen Daten noch eine saubere Methode, und ihre Werte sind untereinander nicht vergleichbar.

Spezialisierte Plattformen wie Peec AI oder Otterly.AI fragen ein von dir definiertes Set regelmäßig ab. Große SEO-Suiten wie Sistrix, Ahrefs, Semrush oder SE Ranking bieten eigene Module zur KI-Sichtbarkeit an. Jedes Tool rechnet mit eigenen Prompts und Formeln, ein Wert von 42 im einen und 38 im anderen sagt nichts über einen Abstand. Google betont im Leitfaden vom Mai 2026, dass kein Drittanbieter Zugriff auf Googles Ranking- oder KI-Systeme hat. Prüfe vor dem Kauf diese Punkte:

  • Die Methode ist offengelegt: Wie viele Läufe je Prompt, welcher Modus, welcher Standort?
  • Deutsche Prompts und der Markt Deutschland, Österreich oder Schweiz sind einstellbar.
  • Rohdaten mit Antworttext und zitierten Quellen lassen sich exportieren.
  • Der Anbieter sagt, ob er über die API oder die Oberfläche abfragt. Beides kann unterschiedliche Antworten liefern.
  • Ein Auftragsverarbeitungsvertrag nach DSGVO liegt vor, falls personenbezogene Daten verarbeitet werden.

Für kleine Unternehmen reicht oft ein manueller Lauf mit 20 Fragen pro Monat und einer Tabellenkalkulation. Ein Tool lohnt sich ab mehreren Märkten oder mehr als 50 Fragen. Wie sich die Messung zur übrigen SEO-Arbeit verhält, erklärt der Ratgeber GEO vs. SEO.

Häufige Fragen

Wie sichtbar bin ich in ChatGPT?

Das zeigt dir nur eine Prompt-Messung. OpenAI stellt keine Impressionsdaten für Website-Betreiber bereit. Messbar sind die Klicks: über den GA4-Kanal AI Assistant und über den Parameter utm_source=chatgpt.com, den ChatGPT an Links anhängt.

Zählen Klicks aus AI Overviews im GA4-Kanal AI Assistant?

Nein. Laut Analytics-Hilfe laufen Klicks aus AI Overviews und AI Mode unter Organic Search. Getrennt davon siehst du in der Search Console nur die Impressionen in diesen Funktionen, keine Klicks.

Gibt es Suchvolumen für Prompts?

Kein KI-Anbieter veröffentlicht solche Zahlen. Manche Tools schätzen ein Prompt-Volumen aus Panels oder Suchdaten; das sind Näherungen, keine Messwerte.

Quellen

Reden wir 30 Minuten darüber

Kostenlos, unverbindlich und mit einer ehrlichen Einschätzung, ob sich GEO bei dir gerade lohnt.

Erstgespräch vereinbaren+49 174 164 5727

Nach oben scrollen