Klare Messregeln.
Überprüfbare Ergebnisse.
Prompt-Kategorien und Markenprompts
Neue Audits enthalten vier Perspektiven: Standort, Leistung / Produkt, Kaufentscheidung und Markennennung. Die Vorschläge werden passend zum belegten Angebot erzeugt; Markenprompts werden mit dem Unternehmensnamen ergänzt. Die Kategorien sind feste Gruppen, ihre Texte bleiben bearbeitbar. Zusätzliche Prompts können innerhalb jeder Gruppe erfasst werden. Frühere Audits behalten ihre ursprüngliche Konfiguration.
Prompts mit Unternehmensname, hinterlegtem Alias oder Domain werden unabhängig von der Kategorie als Markenprompts erkannt. Ihre Antworten erscheinen in einer separaten Auswertung und im CSV, aber nicht in der allgemeinen Sichtbarkeit, im Wettbewerbsranking, in Quellenanalysen oder Bootstrap-Intervallen.
Live-Kreise: Grün bedeutet erwähnt, Rot nicht erwähnt, Grau nicht eindeutig auswertbar. Leere Kreise sind ausstehende Durchläufe. Eine Prompt-Zeile wird erst nach einer abgeschlossenen Auswertung eingeblendet. Die Detailansicht unterscheidet weiterhin Empfehlungen und reine Erwähnungen. Rot ist keine Qualitätsbewertung des Unternehmens. Eine negative Aussage kann gleichzeitig mit einer Empfehlung auftreten und wird separat ausgewiesen.
Der häufigste Wettbewerber pro Prompt wird nach der Zahl belegter Empfehlungen auf gemeinsamer auswertbarer Antwortbasis bestimmt. Jeder Anbieter zählt pro Antwort einmal; Gleichstände werden gemeinsam angezeigt. Der CSV-Export enthält eine Zeile pro geplantem Durchlauf. Fehlende Werte bleiben unklar. Zum Schutz vor Tabellenformeln erhalten entsprechend beginnende Textfelder ein führendes Apostroph; die gespeicherten Originalantworten bleiben unverändert.
Wir beobachten, wie häufig dein Unternehmen in Antworten auf ausgewählte Prompts erscheint. Jede Kennzahl basiert auf gespeicherten Antworten und einer definierten Zählregel.
1. Was wird gemessen?
Eine Beobachtung ist eine Antwort auf eine konkrete Prompt in einer festgelegten Sprache, mit einer festgelegten Ländervorgabe und einer Wiederholung. Jede Anfrage startet ohne vorherigen Gesprächsverlauf. Wir speichern Originalantwort, Zitationen, weitere abgerufene Quellen, Anfrageparameter, Modell und Zeitpunkt.
Neue Vorschläge fragen ausdrücklich nach passenden Anbietern. Wir messen damit Sichtbarkeit bei einer Anbietersuche, nicht bei allen Arten von Informationsfragen. Eigene Änderungen können diese Vergleichsbasis verändern. Frühere Reports und manuell bearbeitete Prompts werden nicht rückwirkend umgeschrieben.
Das Standardpaket enthält acht Prompts und drei Wiederholungen in einem Land und einer Sprache: 24 Antworten. Fragen mit Markennennung werden separat ausgewertet; die Zahl der Antworten für die offene Anbietersuche hängt deshalb von deinen gewählten Prompts ab. Mehr Länder, Sprachen oder Wiederholungen vergrössern den Messplan.
Q: Prompts · R: Wiederholungen · C: Länder · Lc: unterschiedliche ausgewählte Sprachen im jeweiligen Land.
2. Vier unterschiedliche Beobachtungen
Erwähnt: Der Unternehmensname oder ein belegter Alias kommt als vollständige Namensphrase im Antworttext vor. Linktexte zählen; eine URL allein zählt nicht. Eine Nennung kann positiv, neutral oder kritisch sein.
Empfohlen: Das Unternehmen wird als passende Option für das Anliegen vorgeschlagen. Die automatische Einordnung benötigt eine exakte Textstelle als Beleg. Eine beiläufige Nennung oder reine Quellenangabe reicht nicht.
Website zitiert: Mindestens eine URL-Zitation gehört zur eigenen Domain oder einer Subdomain. Im Hintergrund abgerufene, aber nicht zitierte Seiten zählen dafür nicht.
Negativ erwähnt: Eine ausdrücklich kritische Aussage mit exaktem Textbeleg. Keine Empfehlung zu erhalten bedeutet nicht, negativ erwähnt zu werden. Ältere Läufe ohne diese Auswertung bleiben als «nicht erhoben» gekennzeichnet.
Jede Marke und jede Domain zählen höchstens einmal pro Antwort. Zehn Nennungen in einer Antwort erzeugen somit keinen zehnfachen Beitrag. Die drei Raten sind unabhängig und dürfen nicht addiert werden.
3. Fehlende Daten sind keine Nulltreffer
Für jede Kennzahl wird ein eigener Nenner verwendet. Eine unklare Empfehlung kann trotzdem eine eindeutig erkennbare Erwähnung und Zitation enthalten. Fehlende Antworten werden nicht als Nichterwähnungen interpretiert. Der Report nennt absolute Häufigkeiten und offene Bewertungen.
Die semantische Auswertung ist automatisiert. Ein exaktes Zitat belegt die Textgrundlage, garantiert aber noch nicht die richtige Interpretation. Gleichnamige Firmen, mehrdeutige Aussagen und uneinheitliche Aliasnamen können Fehler verursachen. Die Originalantwort bleibt zur Kontrolle zugänglich.
4. Wie der Wettbewerbervergleich entsteht
Erfasst werden konkret genannte, als relevant eingestufte Anbieter. Die Reihenfolge im Ranking richtet sich nach der ausgewählten Rate. Sie ist kein Qualitätsurteil über Unternehmen. Für das Ranking werden je Kennzahl nur Antworten verwendet, in denen sowohl die Anbieter-Auswertung als auch die Beobachtung der eigenen Marke bekannt sind. Alle Anbieter werden auf exakt dieser gemeinsamen Antwortbasis gezählt. Der Überblick nutzt dagegen sämtliche bekannten Beobachtungen je Kennzahl; sein Nenner kann deshalb grösser sein. Ausgeschlossene Antworten werden ausgewiesen. Gleichstände erhalten denselben Rang: Rang = 1 + Anzahl Anbieter mit strikt höherer Trefferzahl. Ein Rang ist keine Aussage über statistische Signifikanz.
Für diesen Anteil verwenden wir ausschliesslich denselben Satz von Antworten mit verfügbarer Anbieter-Auswertung. Jede Marke zählt darin einmal pro Antwort. Der Wert ist ein beobachteter Nennungsanteil, kein Marktanteil oder Anteil am gesamten KI-Suchvolumen.
Eine Wettbewerberlücke liegt vor, wenn eine auswertbare Antwort andere relevante Anbieter nennt, deine Marke aber nicht. Die Priorisierung erfolgt nach der Zahl solcher Antworten; bei Gleichstand bleibt die Reihenfolge der Prompts erhalten. Umsatzpotenzial und Suchvolumen werden nicht geschätzt.
5. Wiederholungen und Stabilität
Generative Antworten können variieren. Wiederholungen untersuchen diese Schwankung bei gleichbleibender Prompt. Sie ersetzen keinen breiteren Fragenkatalog und keine Messung zu einem späteren Zeitpunkt.
Verglichen werden nur Wiederholungen derselben Prompt, desselben Landes und derselben Sprache. Bei R gültigen Antworten entstehen R(R−1)/2 Paare. Ohne ein auswertbares Paar bleibt die Stabilität offen.
Unter der vereinfachenden Annahme unabhängiger Antworten mit konstanter Empfehlungswahrscheinlichkeit p beträgt die Wahrscheinlichkeit, eine mögliche Empfehlung in R Versuchen nie zu beobachten:
Bei angenommenen p = 20 % sind das 51,2 % bei drei und 32,8 % bei fünf Wiederholungen. Das illustriert die Grenzen kleiner Stichproben; p ist kein gemessener Branchenwert. Gemeinsame Suchergebnisse und Modellzustände können die Unabhängigkeitsannahme verletzen.
6. Das 95%-Bootstrap-Unsicherheitsintervall
Bei vollständig auswertbaren Wiederholungen ziehen wir innerhalb jeder Prompt mit Zurücklegen genauso viele Empfehlungsentscheidungen, wie erhoben wurden. Daraus berechnen wir erneut die Empfehlungsrate. Dies wird 10’000-mal wiederholt, getrennt nach Land und Sprache und mit festem Zufallsstartwert 4127.
r* sind die neu berechneten Raten; Q bezeichnet deren empirisches Quantil. Im Code werden die sortierten Werte an Position 250 und 9750 verwendet. Das Intervall beschreibt die beobachtete Wiederholungsvariation unter diesem Messplan. Es ist keine Garantie einer 95%-Abdeckung bei kleinen oder abhängigen Stichproben.
Bei drei identischen Ergebnissen kann ein Bootstrap-Intervall beispielsweise 0–0 % betragen. Das beweist keine Unmöglichkeit einer künftigen Empfehlung. Bei unvollständiger Auswertung wird kein Intervall angegeben. Auswahlverzerrung, Übersetzungsfehler und systematische Klassifikationsfehler sind darin nicht enthalten.
Warum testen Regionspakete nur ausgewählte Länder?
Ein erster Audit soll Unterschiede zwischen konkreten Märkten sichtbar machen, ohne jedes Land einzeln abzufragen. Dafür verwenden wir eine gezielte, nicht zufällige Marktauswahl. Sie orientiert sich am Konzept des «Judgement Sampling»: geeignet zur Exploration, aber anfällig für Auswahlverzerrung. Daraus folgt keine statistische Repräsentativität für Europa oder die Welt. Diese Grenze beschreibt auch Statistics Canada.
So ist die Auswahl aufgebaut
- Schweizer Ausgangspunkt: Schweiz und DACH bleiben eigene, vollständige Ländergruppen. Europa beginnt mit Schweiz, Deutschland, Frankreich und Italien als naheliegenden Vergleichsmärkten.
- Geografische Streuung: Grossbritannien ergänzt Nordeuropa, Polen Osteuropa. Die geografischen Begriffe orientieren sich an der UN-M49-Einteilung; sie ist keine Empfehlung der UN für unsere konkrete Auswahl.
- Unterschiedliche Sprachkontexte: Weitere Pakete kombinieren unterschiedliche Sprachräume. Die Sprachoptionen selbst bleiben separat wählbar; ohne «Landessprache(n)» werden sie nicht automatisch hinzugefügt.
- Begrenzter Umfang: Regionale Pakete enthalten zwei bis sechs Länder, die weltweite Auswahl elf. Diese Grössen sind Produktentscheidungen für einen überschaubaren Einstieg, keine statistisch berechneten Mindeststichproben.
| Paket | Konkrete Länder |
|---|---|
| Schweiz | Schweiz |
| DACH | Schweiz, Deutschland, Österreich |
| Europa · Auswahl | Schweiz, Deutschland, Frankreich, Italien, Vereinigtes Königreich, Polen |
| EU · Auswahl | Deutschland, Frankreich, Italien, Polen, Schweden |
| USA | Vereinigte Staaten |
| Nordamerika · Auswahl | Vereinigte Staaten, Kanada, Mexiko |
| Südamerika · Auswahl | Brasilien, Argentinien, Chile |
| Asien · Auswahl | Japan, Indien, Singapur, Vereinigte Arabische Emirate |
| Afrika · Auswahl | Südafrika, Nigeria, Ägypten |
| Ozeanien · Auswahl | Australien, Neuseeland |
| Ganze Welt · Auswahl | Schweiz, Deutschland, Frankreich, Vereinigte Staaten, Brasilien, Südafrika, Ägypten, Indien, Japan, Singapur, Australien |
Begründung der regionalen Pakete
EU: Deutschland und Frankreich (Westen), Italien (Süden), Polen (Osten) und Schweden (Norden). Nordamerika: USA, Kanada und Mexiko, mit englischen, französischen und spanischen Sprachkontexten. Südamerika: Brasilien für Portugiesisch sowie Argentinien und Chile als zwei spanischsprachige Vergleichsmärkte. Asien: Japan, Indien, Singapur und die Vereinigten Arabischen Emirate für ost-, süd-, südost- und westasiatische Kontexte. Afrika: Südafrika, Nigeria und Ägypten für südliche, westliche und nördliche Teilregionen. Ozeanien: Australien und Neuseeland; die pazifischen Inselstaaten bleiben unberücksichtigt.
Weltweit kombiniert die Auswahl den Schweizer Ausgangspunkt mit Deutschland und Frankreich sowie USA, Brasilien, Südafrika, Ägypten, Indien, Japan, Singapur und Australien. Dadurch werden die fünf grossen geografischen Regionen Europa, Amerika, Afrika, Asien und Ozeanien einbezogen. Viele Länder und Teilregionen bleiben ausdrücklich ungetestet.
Was diese Auswahl nicht leistet
Die konkreten Länder sind redaktionell gewählt, nicht durch ein validiertes Optimierungsmodell. Wir verwenden keine behaupteten KI-Nutzungszahlen, Marktanteile oder Wirtschaftsgewichte. Andere Länder innerhalb derselben Teilregion können andere Ergebnisse liefern. China, Zentralasien und zahlreiche afrikanische Märkte sind beispielsweise nicht in der weltweiten Auswahl. Die Ergebnisse dürfen daher nur auf die tatsächlich getesteten Länder bezogen werden.
Für dein Unternehmen ist die reale Marktbearbeitung entscheidend: Entferne Länder, in denen du nicht tätig bist, und ergänze fehlende Zielmärkte. Länder sind einzeln anpassbar; deine endgültige Auswahl wird mit dem Audit gespeichert. Ein im Prompt genannter Ort bleibt bei Übersetzungen erhalten. Ein Aarau-Prompt testet auch mit deutscher Ländervorgabe weiterhin ein Anliegen in Aarau.
Auswahlversion: purposeful-markets-v2 · Stand 18.09.2026. Änderungen an Paketen verändern keine früher gespeicherten Audits. Wiederholungen erhöhen nicht die geografische Repräsentativität.
Overall-Score in der Vorschau
Der Overall-Score entspricht der Empfehlungsrate auf einer Skala von 0 bis 100: 44 Punkte bedeuten, dass das Unternehmen in rund 44 % der ausgewerteten Antworten empfohlen wurde. Er ist kein zusätzlicher gewichteter Qualitätsindex. Erwähnungen und Webseiten-Zitationen bleiben eigenständige Informationen. Die Vorschau zum Beispielunternehmen AG veranschaulicht Solaranlagen und Wärmepumpen für Privathaushalte.
7. Länder und Sprachen richtig vergleichen
Land und Sprache sind getrennte Einstellungen. Der Länderparameter beschreibt einen ungefähren Nutzerstandort; er garantiert keinen physisch dort ausgeführten Browser. Für Sprachvergleiche sollten Land, Prompts und Wiederholungszahl gleich bleiben.
Die aktuelle Gesamtanzeige zählt die auswertbaren Antworten der gewählten Filter zusammen. Kombinationen mit mehr auswertbaren Antworten erhalten dadurch mehr Gewicht. Sie ist kein gleichgewichteter Länderindex. Bei unterschiedlichen Abdeckungen empfehlen wir einzelne Länder und Sprachen zu vergleichen.
8. Was Quellen aussagen – und was nicht
Domains und Seiten werden nach der Anzahl Antworten mit einer Zitation geordnet. Seiten-URLs werden für die Gruppierung um Fragmente und den Parameter utm_source bereinigt; der ursprüngliche Link bleibt erhalten.
Eine Quelle in einer Antwort mit Wettbewerbern ist ein Prüfhinweis. Daraus folgt weder, dass deine Marke auf dieser Seite fehlt, noch dass die Quelle die Empfehlung verursacht hat. Ohne zusätzliche Seitenprüfung sprechen wir deshalb von «Quellen zur Prüfung». Wettbewerber-Websites werden ohne bestätigte Domainzuordnung nicht als zitiert oder nicht zitiert eingestuft.
Gemeinsame Betrachtung von Nennung und Zitation
Jede vollständig beobachtete Antwort wird genau einer von vier Gruppen zugeordnet: Marke genannt und eigene Website zitiert; nur Marke genannt; nur eigene Website zitiert; weder Marke genannt noch eigene Website zitiert. Unbekannte Werte werden separat geführt. Die vier Gruppen sind disjunkt und ihre Summe ergibt die Zahl der gemeinsam beobachtbaren Antworten.
Einordnung ohne erfundenen Benchmark
Die Themenabdeckung zählt Prompts mit mindestens einer Markennennung. Sie ist keine Marktabdeckung. Das Kurzfazit und die Diagnosen sind regelbasiert aus den gespeicherten Beobachtungen abgeleitet; es wird kein zusätzlicher KI-Score erzeugt. Es gibt keine universelle Grenze für «gut» oder «schlecht». Der Wettbewerbsvergleich beschreibt ausschliesslich den gewählten Audit.
9. Grenzen und verantwortungsvolle Interpretation
- API statt ChatGPT-Oberfläche: Gemessen wird OpenAI Web Search. Personalisierung, Chatverlauf und andere Oberflächenbedingungen werden nicht nachgebildet.
- Einfluss der Messanweisung: Die aktuelle Anweisung verlangt Websuche, passende Optionen, Quellen und eine kurze Antwort. Das kann insbesondere offene Vorgehensfragen in Richtung Anbieterempfehlung lenken.
- Selbst gewählte Prompts: Sie bilden keinen repräsentativen Querschnitt realer Nutzereingaben. Wir kennen kein tatsächliches Suchvolumen dieser Fragen.
- Momentaufnahme: Modelle, Suchindex und Inhalte ändern sich. Wiederholungen an einem Tag ersetzen keine Zeitreihe.
- Keine Wirkungsprognose: Sichtbarkeit beweist weder Reichweite noch Leads oder Umsatz. Massnahmen sind beleggestützte Prüfvorschläge, keine Erfolgsgarantie.
- Vergleichbarkeit: Änderungen an Prompts, Übersetzungen, Modell oder Messanweisung müssen dokumentiert werden. Alte und neue Messungen sind dann nur eingeschränkt vergleichbar.
10. Nachvollziehen und prüfen
Im Report lassen sich Prompts, einzelne Wiederholungen, Übersetzungen, vollständige Antworten und Quellen öffnen. Originaltexte bleiben unverändert. Die Auswertung ist versioniert; neue Klassifikationen werden nicht stillschweigend in ältere Messungen hineingerechnet.
Reports werden geschützt online gespeichert und aktuell über ein Browser-Cookie zugeordnet. Die Verarbeitung benötigt derzeit eine geöffnete Analyseseite. Hintergrundverarbeitung und Benachrichtigungen sind noch nicht aktiv.