HandbuchKapitel 28
Teil VI – UmsetzungKapitel 28

KPIs und Erfolgsmessung

Wie in Kapitel 9.5 ausführlich behandelt, ist die Messung von KI-Sichtbarkeit strukturell schwierig. Dieses Kapitel beschreibt, welche Kennzahlen trotzdem sinnvoll sind und wie man sie interpretiert, ohne sich selbst etwas vorzumachen.

28.1Die zentralen GEO-Kennzahlen#

  • Erwähnungs-Rate (Citation Rate / Mention Rate). In wie viel Prozent der getesteten relevanten Prompts ohne Markennamen wird die eigene Marke genannt?

Die wichtigste Basis-Kennzahl für tatsächliche KI-Sichtbarkeit.

  • Share of Voice (auch Share of Model genannt). Der eigene Anteil an allen Marken-Erwähnungen in einer Kategorie, im Verhältnis zu den Wettbewerbern. Diese Kennzahl macht aus „wir wurden 12-mal genannt“ die aussagekräftigere Information „wir besetzen 12 Prozent der Kategorie-Antworten“.
  • Sentiment. Werden die Erwähnungen als positiv, neutral oder kritisch eingestuft? Eine häufige, aber negative Erwähnung kann schädlicher sein als gar keine.
  • Empfehlungs-Rate (Recommendation Rate). Wird die Marke nur gelistet oder aktiv als präferierte Lösung für einen spezifischen Anwendungsfall hervorgehoben? Diese Kennzahl ist ein starker Indikator für die tatsächliche Vorkaufs-Qualifizierung.
  • Kontext-Korrektheit. Wird die Marke im richtigen Kontext genannt (richtige Kategorie, richtige Positionierung, aktuelle Informationen)?
  • Zitierte Quellen (Citation Sources). Aus welchen Off-Site-Quellen beziehen die Plattformen die Aussagen über die eigene Marke? Diese Kennzahl ist operativ besonders wertvoll, weil sie zeigt, wo Off-Site-Arbeit ansetzen sollte.
  • KI-Crawler-Aktivität (aus Logfiles). Wie häufig besuchen welche KI-Crawler welche Seiten? Ein Frühindikator dafür, ob die eigenen Inhalte überhaupt erfasst werden.

Erwähnungs-Rate, Share of Voice und Empfehlungs-Rate sind für Prompts ohne Markennamen aussagekräftig (Unprompted). Bei Prompts mit Markennamen (Prompted/Branded) zählen vor allem Sentiment, Kontext-Korrektheit und Empfehlungs-Rate.

28.2Benchmark-Werte zur Einordnung#

Zur groben Orientierung einige Benchmark-Werte, überwiegend aus dem B2B-SaaS-Umfeld und daher nicht direkt auf andere Branchen übertragbar35: Eine Erwähnungs-Rate von 8 bis 15 Prozent der relevanten Kategorie-Prompts gilt als Einstiegsniveau (minimale KI-Präsenz). 20 bis 30 Prozent deuten auf eine optimierte, Wirkung zeigende Strategie hin.

Werte über 40 Prozent gelten als Kennzeichen von Kategorieführerschaft. Wichtig: Diese Werte sind keine universellen Ziele. In einer engen Nische mit wenigen Wettbewerbern können auch deutlich höhere Werte normal sein, in einer breiten, stark umkämpften Kategorie sind niedrigere Werte realistisch. Die eigene Entwicklung über die Zeit ist aussagekräftiger als der absolute Vergleich mit einem fremden Benchmark.

28.3Die Versuchung der zu schönen Zahlen#

In der GEO-Vermarktung kursieren beeindruckende Conversion-Zahlen: KI-Traffic konvertiere 2,3-mal, 4,4-mal oder gar 14,2-mal besser als klassischer organischer Traffic. Vorsicht ist angebracht. Die hohen Werte stammen häufig von Anbietern mit kommerziellem Interesse und sind methodisch nicht unabhängig überprüft. Plausibel ist die Grundaussage (wer über eine KI-Empfehlung kommt, ist oft vorqualifizierter und damit abschlussnäher), aber die konkreten Multiplikatoren sollten nicht als belastbare Planungsgröße verwendet werden.

Ein seriöser Umgang mit diesen Zahlen: Die Richtung stimmt (KI-Traffic ist tendenziell hochwertiger), die genaue Höhe ist unsicher. Wer eine ROI-Rechnung auf Basis eines konkreten x-fachen Conversion-Vorteils durchführt, stützt sie auf eine unsichere Grundlage.

28.4Was sich tatsächlich belastbar messen lässt#

Drei Datenquellen sind aktuell vergleichsweise belastbar:

  • Vertriebs-Feedback. Die in Kapitel 5 beschriebene strukturierte Erfassung der Recherche-Quellen im Erstgespräch misst tatsächliches Käuferverhalten. Wenn der Anteil der Interessenten, die KI-Plattformen als Recherche-Quelle nennen, steigt, und gleichzeitig mehr von ihnen die eigene Marke schon kennen, ist das ein belastbares Signal.
  • Manuelle Stichproben über Zeit. Eine konsistent durchgeführte Quartals-Stichprobe derselben Prompts zeigt die eigene Entwicklung zuverlässiger als viele Tool-Momentaufnahmen.
  • Logfile-Daten zur Crawler-Aktivität. Ob und wie oft KI-Crawler die eigenen Seiten besuchen, ist technisch messbar, im Gegensatz zur Frage, was in den Antworten passiert.

28.5Eine pragmatische KPI-Struktur für KMU#

Für ein KMU mit kleinem Team empfiehlt sich ein schlankes KPI-Set, das quartalsweise erhoben wird:

  • Erwähnungs-Rate über die definierte Prompt-Liste (manuell plus Tool).
  • Share of Voice gegenüber den drei wichtigsten Wettbewerbern.
  • Anteil der Erstgespräche, in denen KI-Plattformen als Recherche-Quelle genannt werden (aus CRM).
  • Anzahl und Art der identifizierten falschen oder veralteten KI-Aussagen.
  • Entwicklung der Off-Site-Präsenz (Anzahl relevanter Erwähnungen, gepflegte Profile).

Mehr braucht es zu Beginn nicht. Ein überladenes KPI-Dashboard, das niemand verarbeitet, bringt weniger als fünf konsequent erhobene Kennzahlen mit entsprechenden Schlussfolgerungen.

Quellen und Anmerkungen

  1. 35Discovered Labs, „GEO Metrics“, Januar 2026; Topify, „10 KPIs to Track AEO & GEO Performance“, April 2026.

Stand: