Leistung
Prompt-Monitoring: sehen, ob sich in KI-Antworten etwas bewegt
Eine Messung ist eine Momentaufnahme. Erst das Prompt-Tracking über Monate zeigt, ob Maßnahmen wirken, in welchem System zuerst — und ob eine Veränderung echt ist oder nur Rauschen.
Kurz gesagt: Beim Prompt-Monitoring wird dasselbe Fragenset jeden Monat über dieselben KI-Systeme abgefragt, immer in drei Läufen und mit derselben Zählweise. Daraus entsteht eine Zeitreihe, die Trend von Zufall unterscheidet und Falschaussagen über dein Unternehmen früh sichtbar macht.
Warum einmal messen nicht reicht
Sprachmodelle antworten probabilistisch. OpenAI nennt die Ausgaben seiner Modelle in der eigenen Dokumentation ausdrücklich nicht deterministisch. Zwei identische Fragen können zwei verschiedene Anbieterlisten ergeben, ohne dass sich irgendetwas geändert hätte. Wer daraus Schlüsse zieht, feiert Zufallstreffer und erschrickt vor Zufallsausfällen.
Dazu kommt, dass sich die Systeme selbst ändern: neue Modellversionen, andere Suchindizes, neue Quellen. Eine Nennung, die im März stabil war, kann im Juni fehlen, obwohl du nichts anders gemacht hast. Ohne Zeitreihe erfährst du davon erst, wenn Anfragen ausbleiben.
Deshalb gilt bei uns: derselbe Fragensatz, dieselben Systeme, dieselbe Zählweise, jeden Monat. Ändert sich das Set, beginnt die Zeitreihe von vorn — was wir dann auch so sagen und nicht stillschweigend in den alten Verlauf einrechnen.
Trend oder Rauschen: wie wir die Zahlen lesen
Das Rechenbeispiel ist einfach. Bei 30 Fragen und drei Läufen liefert jedes System 90 Antworten pro Monat. Eine einzige zusätzliche Nennung verschiebt die Nennungsrate damit um gut einen Prozentpunkt. Steigt sie von einem Monat zum nächsten um zwei oder drei Punkte, ist das noch kein Erfolg, sondern möglicherweise nur ein glücklicher Lauf.
Wir bewerten deshalb erst ab mindestens drei Messungen und sehen uns an, ob die Bewegung in allen drei Läufen auftritt, bei mehreren Fragen gleichzeitig und in die gleiche Richtung. Im Report steht zu jeder Kennzahl, ob die Veränderung aus unserer Sicht belastbar ist oder nicht. Wenn wir es nicht wissen, schreiben wir das hin.
Was ausgewertet wird
- Nennungsrate je System im Zeitverlauf, mit Vergleich zum Vormonat und zum Startwert
- Zitationsrate — wie oft ist zusätzlich deine Domain als Quelle verlinkt
- Share of Voice gegen die Wettbewerber im selben Set
- Quellenverschiebung — welche Seiten zitieren die Systeme neuerdings, welche nicht mehr
- Tonalität und Falschaussagen über dein Unternehmen, sobald sie auftauchen
- KI-Referral-Traffic aus deiner Webanalyse, soweit er sich zuordnen lässt
Die Falschaussagen werden unterschätzt. KI-Systeme erfinden Öffnungszeiten, ordnen Leistungen zu, die es nicht gibt, und verwechseln Firmen mit ähnlichem Namen. Wer monatlich dieselben Markenfragen stellt, findet solche Halluzinationen, bevor Kunden sie finden.
Beim Referral-Traffic sind die Systeme unterschiedlich gut messbar. ChatGPT hängt laut OpenAI an Links aus der Suche automatisch den Parameter utm_source=chatgpt.com an. Klicks aus Google AI Overviews und AI Mode dagegen zählt Google laut eigener Dokumentation in die normale Websuche der Search Console ein, ohne sie getrennt auszuweisen. Wir sagen dir deshalb, welche Zahl woher stammt und was sie nicht zeigt.
So läuft ein Monat ab
- 1
Messung
monatlichDas feste Set wird über ChatGPT, Perplexity, Gemini und Google AI Overviews abgefragt, jede Frage dreimal. Jede Antwort wird mit Datum und Screenshot gesichert.
- 2
Auswertung
monatlichVergleich mit Vormonat und Startwert, Prüfung auf Falschaussagen, Abgleich der zitierten Quellen und der Referral-Daten.
- 3
Report
monatlichZahlen, auffällige Veränderungen, Einschätzung der Belastbarkeit und die Empfehlung für den nächsten Monat.
- 4
Gespräch
30 Minuten im MonatWir gehen den Report mit dir durch und legen fest, was als Nächstes umgesetzt wird.
- 5
Bewertung der Richtung
frühestens nach 3 MessungenErst dann entscheiden wir gemeinsam, ob die Maßnahmen wirken, ob das Set noch passt und ob sich die Arbeit weiter lohnt.
Was du konkret bekommst
- Monatlichen Report mit Nennungsrate, Wettbewerb und Trend, jede Kennzahl mit Erklärung, wie sie zustande kommt
- Warnhinweise zu Falschaussagen über dein Unternehmen, mit Frage, System und Wortlaut
- Rohdaten auf Wunsch — jede Frage, jede Antwort, jeder Screenshot mit Zeitstempel
- Empfehlung für den Folgemonat, abgeleitet aus den Zahlen, nicht aus einer Jahresroadmap
- Monatlichen Call von 30 Minuten
Keine Dashboards, durch die du dich selbst klicken musst, und keine Kennzahl, deren Zustandekommen wir nicht erklären können. Die Rohdaten sind die Grundlage, auf der du unsere Aussagen selbst nachprüfen kannst — und deshalb bekommst du sie.
Wie eine Monatsübersicht aussieht
| System | Startwert | Vormonat | Aktuell | Einschätzung |
|---|---|---|---|---|
| Perplexity | 11 von 90 | 17 von 90 | 21 von 90 | Anstieg über drei Messungen, mehrere Fragen, alle Läufe — belastbar |
| ChatGPT | 8 von 90 | 7 von 90 | 10 von 90 | innerhalb der Schwankung, noch kein Trend |
| Gemini | 5 von 90 | 5 von 90 | 4 von 90 | unverändert |
| Google AI Overviews | 3 von 42 | 4 von 45 | 4 von 39 | Nenner schwankt, weil nicht zu jeder Frage eine AI Overview erscheint |
Die letzte Spalte ist der eigentliche Wert des Reports. Die Zahl allein sagt wenig; entscheidend ist, ob sie trägt.
Wir oder ein Tool?
Für Prompt-Monitoring gibt es inzwischen eigene SaaS-Werkzeuge, etwa Peec AI, Otterly.AI oder Profound. Sie sind im Tool-Verzeichnis mit Stärken und Grenzen beschrieben. Wenn du ein Team hast, das selbst auswertet, und viele Prompts oder Märkte automatisiert verfolgen willst, kann ein solches Tool die bessere Wahl sein.
Unser KI-Monitoring ist etwas anderes: eine Dienstleistung, bei der jemand die Antworten liest, Falschaussagen erkennt, die Schwankung einordnet und daraus eine Empfehlung macht. Nutzt du ein Tool bereits, arbeiten wir auch damit. Die Zahlen sind dann aber nicht mit früheren Messungen aus unserem eigenen Aufbau vergleichbar, und das sagen wir dazu.
Für wen sich Prompt-Monitoring lohnt
Passt, wenn …
- ein Startwert aus einem Audit vorliegt oder erhoben werden soll
- du an deiner KI-Sichtbarkeit arbeitest und wissen willst, ob es wirkt
- deine Marke verwechselbar ist oder KI-Systeme schon Falsches über dich geschrieben haben
- du eine Einordnung willst, nicht nur Zahlen
Eher nicht, wenn …
- du Hunderte Prompts in vielen Sprachen täglich verfolgen willst — dafür sind Tools gebaut
- gerade nichts umgesetzt wird und auch nichts geplant ist
- du nach vier Wochen ein abschließendes Urteil brauchst
- du das Fragenset jeden Monat neu zusammenstellen möchtest
Was wir von dir brauchen
- Das abgestimmte Prompt-Set, idealerweise aus dem GEO-Audit
- Lesezugriff auf deine Webanalyse, wenn Referral-Traffic Teil des Reports sein soll
- Einen Ansprechpartner, der Falschaussagen fachlich bestätigen oder entkräften kann
Was Prompt-Monitoring nicht leistet
Monitoring misst, es verändert nichts. Ohne Umsetzung zwischen den Messungen entsteht eine sehr genaue Beschreibung eines Zustands, der gleich bleibt. Es ersetzt keine Rankingdaten aus Google und zeigt nicht, wie viele Menschen eine Frage tatsächlich stellen. Und es gibt keine Garantie für steigende Nennungen.
Aufwand und Kosten
Das monatliche Prompt-Monitoring ist Bestandteil der laufenden Betreuung ab 1.500 € netto im Monat, monatlich kündbar, mit Report und 30-Minuten-Call. Der Umfang wird nach dem Audit festgelegt. Details unter Preise.
Verwandte Begriffe
Prompt-Set, Nennungsrate, Share of Voice in KI-Antworten, Citation, Sentiment, Temperatur, Halluzination, KI-Referral-Traffic.
Weiterlesen
- Werkzeug: Prompt-Set-Generator — Fragenset und Messprotokoll für den eigenen Test
- KI-Sichtbarkeit messen
- Prompt-Monitoring-Tools im Vergleich
- GEO-KPIs und Reporting
- Leistung: Laufende GEO-Betreuung — Monitoring plus Umsetzung
Quellen
Stand: September 2026
- OpenAI: Text generation — Modellausgaben sind nicht deterministisch
- OpenAI Help Center: Publishers and Developers FAQ — Parameter utm_source=chatgpt.com in Referral-Links
- Google Search Central: AI features and your website — Traffic aus AI Overviews und AI Mode in der Search Console
- OpenAI: Overview of OpenAI Crawlers — OAI-SearchBot als Grundlage der Suche in ChatGPT
Häufige Fragen
Wie oft wird gemessen?
Monatlich, jeweils in drei Läufen je Frage und System. Wöchentlich lohnt sich aus unserer Sicht nur während einer laufenden Kampagne oder in sehr schnellen Märkten.
Welche Systeme sind dabei?
Standard sind ChatGPT, Perplexity, Gemini und Google AI Overviews. Weitere Systeme wie Claude oder Microsoft Copilot nehmen wir dazu, wenn deine Zielgruppe sie nachweislich nutzt.
Kann ich das Set später ändern?
Ja, aber wir werten es dann getrennt aus. Der ursprüngliche Kern bleibt unverändert, damit die Zeitreihe intakt bleibt; neue Fragen bilden ein zweites Set mit eigenem Startwert.
Brauche ich dafür ein Tool-Abo?
Nein. Wir messen mit unserem eigenen Aufbau. Wenn du ein Tool wie Peec AI ohnehin nutzt, arbeiten wir auch damit — die Zahlen sind dann aber nicht mit unseren früheren vergleichbar.
Ab wann sieht man, ob etwas wirkt?
Belastbar frühestens nach drei Messungen. Einzelne Systeme reagieren schneller als andere, aber ein einzelner guter Monat ist noch kein Trend. Das steht so auch im Report.
Kann ich Prompt-Monitoring ohne vorheriges Audit buchen?
Der Umfang wird nach dem Audit festgelegt, weil dort Set und Startwert entstehen. Hast du bereits ein sauber dokumentiertes Fragenset mit Messwerten, sprechen wir im Erstgespräch darüber, ob es als Grundlage taugt.
Was passiert, wenn eine KI Falsches über uns sagt?
Wir melden es dir mit Frage, System und Wortlaut. Dann prüfen wir, aus welchen Quellen die Aussage stammen könnte, und schlagen eine Korrektur vor — meist auf der eigenen Website und in den Profilen, auf die sich das System stützt.
Wie werden Google AI Overviews gezählt, wenn keine erscheint?
Getrennt. Erscheint zu einer Frage keine AI Overview, zählt diese Antwort nicht als „nicht genannt“, sondern fällt aus dem Nenner. Sonst sähe es nach einem Rückgang aus, wo Google nur weniger AI Overviews ausspielt.
Passt das zu dir?
30 Minuten, kostenlos, mit einer ehrlichen Einschätzung — auch dann, wenn die Antwort lautet, dass sich das für dich gerade nicht lohnt.