Alle Ressourcen
Monitoring & Analytics4 min Lesezeit

Die GEO-Kennzahlen, die wirklich zählen

Zitierrate, Sentiment je LLM, Share of Voice, herangezogene Quellen: die GEO-Kennzahlen, die wirklich zählen — und die, die man ignorieren sollte.

Die GEO-Kennzahlen, die wirklich zählen

SEO hat seine Kennzahlen. Durchschnittliche Position, Klickrate, Impressionen, organischer Traffic. Jahre der Praxis haben einen gemeinsamen Referenzrahmen geschaffen. Jeder weiß, was ein guter DA bedeutet. Jeder liest dieselben Dashboards.

Das GEO hat diesen Referenzrahmen noch nicht. Der Markt ist jung. Die Tools befinden sich im Aufbau. Und in dieser Unschärfe messen viele GEO-Dashboards, was leicht zu messen ist — nicht, was zählt.

Hier sind die Signale, die wirklich Aufmerksamkeit verdienen.

Die Zitierrate, nicht die reine Präsenz

Die erste naheliegende Kennzahl ist die Präsenz: Wird meine Marke in den Antworten der LLMs erwähnt? Das ist die Nullstufe. Nützlich, um eine völlige Abwesenheit zu erkennen, aber nicht ausreichend, um zu steuern.

Entscheidend ist die gewichtete Zitierrate: Bei Prompts, die mit meiner Kategorie zu tun haben, in welchem Anteil der Antworten tauche ich auf? Und vor allem: Verändert sich dieser Anteil im Zeitverlauf?

Eine steigende Zitierrate zeigt, dass Content-, Aktivierungs- und Monitoring-Maßnahmen Früchte tragen. Eine stabile Rate trotz Investitionen in Content deutet entweder auf aktivere Konkurrenz hin oder auf ein technisches Lesbarkeitsproblem, das die Bemühungen zunichtemacht.

Das Sentiment je LLM

Zitiert zu werden ist gut. Positiv zitiert zu werden ist das Ziel.

Das Marken-Sentiment in LLMs ist eine Kennzahl, die es vor zwei Jahren noch nicht gab. Heute messen die fortschrittlichsten GEO-Tools sie: Wie ist für jedes LLM der allgemeine Ton der Markenerwähnungen? Positiv, neutral, negativ? Und auf welchen konkreten Attributen baut sich dieses Sentiment auf?

Die Multi-LLM-Dimension spielt hier eine wichtige Rolle. Positives Sentiment auf Perplexity und negatives auf ChatGPT ist eine häufige Situation. Sie deutet oft darauf hin, dass beide Modelle unterschiedliche Quellen heranziehen — ein alter Vergleichstest, den ChatGPT sieht, aktuelle positive Presseberichte, auf die Perplexity zugreift. Das zu erkennen bedeutet zu wissen, wo man ansetzen muss.

Der Share of Voice nach Prompt-Kategorie

Ein Wettbewerber kann eine niedrigere Gesamt-Zitierrate haben als Sie und Sie trotzdem bei den Prompts überholen, die am meisten konvertieren.

Die Segmentierung nach Prompt-Kategorie ist entscheidend: Vergleichs-Prompts ("X vs. Y"), Kaufabsichts-Prompts ("bestes X für Y"), Entdeckungs-Prompts ("was ist X"), Validierungs-Prompts ("ist X vertrauenswürdig"). Bei jedem dieser Blickwinkel kann der Share of Voice sehr unterschiedlich ausfallen.

Eine B2B-Marke kann bei Entdeckungs-Prompts gut positioniert sein und bei Vergleichs-Prompts fehlen — genau dort, wo Kaufentscheidungen fallen. Das ist eine präzise Diagnose, die die Content-Prioritäten lenkt.

Die Qualität der herangezogenen Quellen

LLMs zitieren nicht alle Inhalte, mit denen sie trainiert wurden. Sie zitieren nur einen Teil der Quellen — oft die aktuellsten, die am besten strukturierten oder die mit dem stärksten Vertrauenssignal.

Zu verfolgen, welche Quellen LLMs heranziehen, wenn sie über Ihre Marke sprechen, ist eine mächtige Diagnose-Kennzahl. Wenn es sich systematisch um Vergleichstests Dritter handelt, die Sie nicht kontrollieren, die zwei Jahre alt sind und veraltete Informationen enthalten — dann wissen Sie, wo Sie ansetzen müssen.

Wenn Ihre eigenen Seiten anfangen, als Quelle aufzutauchen, ist das ein Zeichen für technischen Fortschritt (KI-Lesbarkeit, llms.txt) und redaktionellen Fortschritt.

Die Entwicklung über die Zeit, nicht die Momentaufnahme

All diese Kennzahlen sind als Momentaufnahme wenig aussagekräftig. GEO ist eine mittelfristige Disziplin. Eine Zitierrate, die innerhalb von sechs Monaten bei den Kauf-Prompts der Kategorie von 12 % auf 18 % steigt, ist ein starkes Signal. Eine Momentaufnahme von 18 % ohne Ausgangswert ist nur Rauschen.

Die Trendmessung erfordert Regelmäßigkeit. Wöchentlich für Sentiment- und Zitierrate bei den wichtigsten Prompts. Monatlich für den Wettbewerbs-Share-of-Voice. Vierteljährlich für das Audit der herangezogenen Quellen.

Vurto strukturiert dieses Monitoring fortlaufend, mit Granularität nach LLM, nach Prompt-Kategorie und nach Wettbewerber. Das Dashboard zeigt den Trend, nicht nur die Momentzahl. Das ist selten unter den Tools am Markt, die oft nur statische Ansichten bieten.

Was nicht in ein GEO-Dashboard gehört

Ein paar Kennzahlen, die häufig auftauchen und keine GEO-Strategie steuern sollten.

Die reine Gesamtzahl der Erwähnungen. Ohne Gewichtung nach Kontextqualität oder Prompt-Relevanz ist diese Zahl wenig hilfreich. Eine Marke kann 500-mal pro Woche erwähnt werden — in negativen oder unpassenden Zusammenhängen.

Das Ranking in "Top-GEO-Tools"-Listen. Manche Anbieter bauen ihre eigene Prompt-Basis so, dass sie zu den Benchmarks passt, die ihnen nützt. Vorsicht vor selbstreferenziellen Rankings.

Die Präsenz auf "exotischen" LLMs mit geringem Nutzungsanteil. Zehn LLMs zu überwachen, von denen acht nur 0,1 % Marktanteil haben, ist Rauschen. Die Konzentration auf ChatGPT, Gemini, Perplexity und Claude deckt den Großteil des realen generativen Traffics ab.

Die Frage, die man sich jede Woche stellen sollte

Wächst meine Sichtbarkeit in den LLMs bei den Prompts, die meinen tatsächlichen Käufern entsprechen?

Nicht "werde ich erwähnt", sondern "werde ich in den richtigen Gesprächen erwähnt, im richtigen Sinne, mit den richtigen Quellen?"

Diese Frage ist es, die GEO-Monitoring in strategische Steuerung verwandelt.


Vurto überwacht fortlaufend die Zitierrate, das Markensentiment, den Wettbewerbs-Share-of-Voice und die von LLMs herangezogenen Quellen.