Skip to main content

Ihre Server-Logs benennen die Drittanbieter-Seiten, die KI etwas über Ihre Marke beibringen.

Wenn KI-Tools wie ChatGPT etwas über Ihre Marke lernen, beginnen sie oft bei anderen Websites, die Sie erwähnen: Bewertungen, Forenbeiträge, Vergleichsartikel. Jedes Mal, wenn ein KI-Crawler einem Link von einer dieser Seiten zu Ihrer folgt, hält Ihr Server es fest. Der Haken ist, dass die meisten KI-Crawler nicht verraten, von welcher Seite sie kamen. Ein Crawler, PetalBot, tut es. Er meldet jedes Mal die genaue externe Seite, die auf Sie verlinkt hat. Das liefert Ihnen eine laufende Liste, erstellt aus Aufzeichnungen, die Sie ohnehin schon führen, der Seiten, die am wahrscheinlichsten prägen, was KI über Ihre Marke sagt. Diese Anleitung erklärt, wie es funktioniert, wie Sie die Liste selbst erstellen und was sie belegen kann und was nicht.

Crawler-Forensik: PetalBot offenbart die Drittanbieter-Seiten, die am wahrscheinlichsten KI-Zitate über Ihre Marke speisen
Die Hypothese
  1. AI crawlers reach you by following backlinks, and that leaves a footprint. GPTBot and others do not only crawl your sitemap. They also arrive by following a link from a third-party page that mentions your brand: a forum thread, a comparison article, a review. That link-following happens in real time and lands in your server logs, timestamped and fresh.
  2. Most crawlers hide where they came from. PetalBot does not. Nearly every LLM crawler fetches your pages without saying which page sent it. PetalBot does the opposite: it reports the exact referring URL on its hits. That single behavior turns a log line into a source citation.
  3. PetalBot and the LLM crawlers largely read the same web. So when PetalBot hands you a referring URL, it is pointing at a page the AI crawlers are plausibly reading too. Pull those URLs and you have a first-party shortlist of the third-party pages most likely shaping what AI says about your brand.
  4. The overlap with AI crawlers is inferred, not confirmed. We can see PetalBot's path. We cannot see OpenAI's. Whether this data feeds citation grounding or model training is something the logs cannot tell us either. The method is useful anyway, and its limits are spelled out below.

Eine Crawler-Forensik-Hypothese. Ihre Server-Logs enthalten bereits einen groben Index der Drittanbieter-Seiten, die am wahrscheinlichsten speisen, was KI über Ihre Marke sagt. Sie sammeln die Daten fast sicher und werfen das Signal weg.

Die meisten stellen sich KI-Crawler so vor, wie sie sich Googlebot vorstellen: Er liest Ihre sitemap, folgt Ihren internen Links und indexiert Ihre Seiten. Das passiert. Aber es ist nicht der einzige Weg, auf dem GPTBot und die anderen Sie erreichen.

Sie kommen auch an, indem sie einem Backlink folgen: ein Forenbeitrag, der Sie mit einem Wettbewerber vergleicht, eine Bewertung auf einer Seite, von der Sie nie gehört haben, ein Übersichtsartikel, der auf Ihre Produktseite verlinkt. Wenn ein KI-Crawler einem dieser Links folgt, geschieht das nahezu in Echtzeit und landet mit einem Zeitstempel in Ihren Access-Logs.

Jedes Folgen eines Links hält eine Tatsache fest, mit der Sie etwas anfangen können. Eine Drittanbieter-Seite hat Sie erwähnt, und ein Crawler ist dem Link gefolgt, um Sie zu erreichen.

Der übliche Weg herauszufinden, welche Drittanbieter-Seiten KI-Antworten prägen, ist, ChatGPT, Perplexity und die übrigen anzustoßen und die Quellen aus dem JSON zu extrahieren, das sie zurückgeben. Das funktioniert, und Sie sollten es tun. Aber es betrachtet das Problem von außen, ein Prompt nach dem anderen. Ihre eigenen Logs lassen Sie von innen schauen, fortlaufend, an Daten, die niemand ratenbegrenzen oder Ihnen wegnehmen kann.

Most Crawlers Will Not Tell You Where They Came From

Ein gefolgter Backlink ist nur nützlich, wenn der Crawler Ihnen sagt, welcher Seite er gefolgt ist, und das steht an einem einzigen Ort: im Referer Header, den der Crawler mit seiner Anfrage sendet.

Fast keiner der LLM-Crawler sendet ihn. Sie rufen Ihre Seite ab und halten nichts darüber fest, woher sie kamen. Sie sehen den Besuch. Sie sehen die Quelle nicht.

CrawlerMeldet er die verweisende Seite?
GPTBotKein Referrer gemeldet
ClaudeBotKein Referrer gemeldet
PerplexityBotKein Referrer gemeldet
BingbotKein Referrer gemeldet
PetalBotMeldet die vollständige verweisende URL

Der Großteil des Crawls, der Sie interessiert, ist also an der Quelle anonym. Sie können belegen, dass ein KI-Bot Sie besucht hat. Sie können nicht belegen, was ihn geschickt hat. Ein Crawler schließt diese Lücke.

PetalBot Is the Exception

PetalBot ist der Crawler hinter Huaweis Petal Search. Er ist nicht der Bot eines KI-Labors. Aber er tut eine Sache, die fast nichts anderes tut: Bei seinen Anfragen meldet er die verweisende URL. Die genaue Drittanbieter-Seite, der er gefolgt ist, um Ihre zu erreichen, Query-String und alles.

In unseren Logs ist dieses Verhalten nicht gelegentlich. Es ist die Regel.

100%
der von uns untersuchten PetalBot-Zugriffe trugen die vollständige zitierende URL
Query-Strings erhalten
Referrer kommen intakt an, nicht auf die bloße Domain gekürzt

Eine PetalBot-Log-Zeile schließt die Lücke. Ein normaler KI-Crawler-Zugriff sagt Ihnen, dass ein Bot angekommen ist. Ein PetalBot-Zugriff sagt Ihnen, dass ein Bot angekommen ist und benennt die Seite, die ihn geschickt hat.

Eine einzelne PetalBot-Anfrage, annotiert
203.0.113.x - - [20/Jul/2026:14:22:07 +0000] "GET /products/widget-pro HTTP/1.1" 200 18244 "https://forum.example.com/thread/best-widgets-2026?sort=top" "PetalBot"
Der ReferrerDie Drittanbieter-Seite, der PetalBot gefolgt ist, um Sie zu erreichen. Das ist der Zitationskandidat. Der Query-String bleibt erhalten, sodass Sie auf genau der Ansicht landen, nicht auf einer Vermutung.
Der ZeitstempelWann der Link begangen wurde. Frische Referrer zählen mehr als alte: Eine Seite, die heute gecrawlt wird, ist eine Seite, die heute im Umlauf ist.
Das ZielAuf welche Ihrer Seiten die Drittanbieter-Seite verlinkt hat. Das sagt Ihnen, was an Ihrer Marke anderswo diskutiert wird.

Wir ordnen PetalBot zudem unter die höflicheren Crawler ein, die wir sehen, gemessen an den Spitzenanfragen pro Minute in unseren Logs. Er hämmert nicht auf Ihren Origin ein. Es gibt kaum betriebliche Kosten, ihn in Ruhe zu lassen, und echte Signalkosten, ihn zu blockieren.

Blockieren Sie PetalBot nicht. Ihn zu blockieren ist der eine Schritt, der dieses gesamte Signal wegwirft.

PetalBot and the LLM Crawlers Read the Same Web

Der nächste Schritt ist der Punkt, an dem die Methode aufhört, Beobachtung zu sein, und zur Schlussfolgerung wird.

PetalBot und die LLM-Crawler lesen größtenteils dasselbe Web. Sie folgen denselben Links, von denselben Bewertungsseiten und Foren und Vergleichsartikeln, weil dort die Erwähnungen Ihrer Marke leben. Wenn PetalBot Ihnen also eine verweisende URL übergibt, zeigt er auf eine Seite, die die KI-Crawler plausibel ebenfalls lesen.

PetalBot meldet seinen Referrer und die LLM-Crawler tun es nicht. Nutzen Sie, was er meldet, als Ersatz für das, was sie zurückhalten.

Drittanbieter-Seite
Eine Bewertung, ein Forenbeitrag oder ein Vergleichsartikel, der Ihre Marke erwähnt und auf Sie verlinkt.
PetalBot folgt dem Link
und hält die verweisende URL in Ihrem Access-Log fest, mit Zeitstempel und vollständig.
LLM-Crawler folgen ihm plausibel ebenfalls
und lesen dieselbe Seite aus demselben Grund. Dieser Schritt ist gefolgert, nicht beobachtet.

Die Technik ist Triangulation. Sie können das Ziel nicht direkt sehen, also messen Sie etwas, das sich mit ihm bewegt. Hier ist das Messbare PetalBots Verweisspur, die in einer Log-Datei sitzt, die Ihnen bereits gehört.

Build the Graph: From Raw Logs to a Citation Shortlist

Nichts davon braucht ein neues Werkzeug. Es braucht die Logs, die Sie bereits sammeln, und ein paar Filterschritte.

1

Loggen Sie am Edge und behalten Sie den Referer Header

Erfassen Sie Anfragen am Server oder am CDN, nicht in einem JavaScript-Tag, denn Crawler führen das Tag nicht aus. Das eine Feld, von dem diese ganze Methode abhängt, ist Referer. Wenn Ihr Logging ihn entfernt oder Query-Strings abschneidet, beheben Sie das zuerst. Sie können keinen Header wiederherstellen, den Sie nie gespeichert haben.

2

Filtern Sie auf PetalBot-Zugriffe, die einen Referrer von Dritten tragen

Passen Sie den PetalBot-user-agent ab und behalten Sie dann nur die Zugriffe, deren Referrer auf eine Domain zeigt, die nicht Ihre ist. Diese externen Referrer sind Ihre Zitationskandidaten. Verwerfen Sie Selbstverweise und leere Referrer; sie sind für diesen Zweck Rauschen.

3

Entfernen Sie Duplikate auf Seitenebene und fassen Sie dann nach Domains zusammen

Derselbe Forenbeitrag wird viele Male auftauchen. Fassen Sie wiederholte URLs zu eindeutigen Seiten zusammen, gruppieren Sie die Seiten dann unter ihrer Domain. Nun haben Sie zwei Sichten: die einzelnen Seiten, die auf Sie verlinken, und die Websites, auf denen diese Seiten leben.

4

Gewichten Sie nach Aktualität und Wiederkehr

Ein Referrer, der diese Woche fünfzigmal gesehen wurde, rangiert über einem, der letztes Quartal einmal gesehen wurde. Gewichten Sie jeden Kandidaten danach, wie oft er wiederkehrt und wie kürzlich er zuletzt begangen wurde. Aktualität ist die wichtigere Hälfte: Eine Seite, die jetzt gecrawlt wird, ist eine Seite, die jetzt im Umlauf ist.

5

Gleichen Sie gegen die LLM-Crawler auf Ihren eigenen Seiten ab

Bringen Sie das Timing in Deckung. Wenn ein PetalBot-Verweis auf Ihre Produktseite zeigt, prüfen Sie, ob GPTBot, ClaudeBot oder die anderen dieselbe Seite im selben Zeitfenster getroffen haben. Überlappung im Timing stärkt den Fall, dass die Drittanbieter-Seite Teil dessen ist, was KI derzeit über Sie liest.

6

Ranken Sie sie und behandeln Sie sie als Auswahlliste

Heraus kommt eine gerankte Liste von Drittanbieter-Seiten und Domains, die am wahrscheinlichsten KI-Antworten über Ihre Marke speisen, vollständig aus First-Party-Daten erstellt. Behandeln Sie sie als Liste von Ansatzpunkten, die es zu untersuchen gilt, nicht als bewiesenes Zitationsset.

Oder überspringen Sie die Pipeline

Die Schritte 1 bis 6 sind genau das, was WISLR.ai für Sie ausführt. Es erfasst KI-Crawler- und PetalBot-Aktivität am Edge, behält die Referrer und verwandelt sie in einen gerankten, stets aktuellen Feed der Drittanbieter-Seiten, die am wahrscheinlichsten prägen, was KI über Ihre Marke sagt, abgeglichen gegen die LLM-Crawler, die Ihre eigene Website treffen. Kein Log-Gefummel erforderlich.

Build it with WISLR.ai →

What the Graph Is Good For

Ein gerankter Feed von Seiten, die über Sie sprechen, fortlaufend aktualisiert, ist nützlich, ob die KI-Grounding-Hypothese nun hält oder nicht.

Korrigieren Sie Fehlinformationen an der Quelle. Wenn eine Seite in Ihrem Verweis-Feed etwas Falsches über Ihre Marke sagt und oft genug gecrawlt wird, um aufzutauchen, wissen Sie jetzt genau, wo Sie reagieren müssen. Sie raten nicht mehr, welche von tausend Seiten zählt. Die Crawler haben Ihnen gesagt, welche im Umlauf sind.

Entdecken Sie Erwähnungen, von denen Sie nicht wussten, dass sie existieren. Die meiste Markenüberwachung beobachtet eine Liste, die Sie erstellt haben. Diese beobachtet eine Liste, die das Web erstellt hat, und übergibt Ihnen Bewertungen, Beiträge und Vergleichsseiten, die Sie nie verfolgt haben, direkt aus Ihren eigenen Access-Logs.

Wenn die KI-Grounding-Hypothese nie hält, haben Sie immer noch einen Markenüberwachungs-Feed, erstellt aus Daten, die Sie bereits sammeln. Wenn sie hält, haben Sie eine Karte davon, wo KI über Sie lernt.

What We Are Assuming, and What We Cannot See

Unter dieser Methode liegen zwei Annahmen, und keine ist bestätigt. Es lohnt sich trotzdem, sie zu nutzen, aber nur, wenn Sie wissen, wo sie aufhört.

Wir nehmen an, dass PetalBot und die LLM-Crawler denselben Links folgen.

Wir können PetalBots Pfad sehen. Wir können OpenAIs nicht sehen. Die Überlappung ist eine vernünftige Wette, weil beide das offene Web crawlen, in dem Markenerwähnungen leben, aber es ist eine Wette. Manche von PetalBots Referrern werden Seiten sein, die kein KI-Crawler je liest, und manche Seiten, die KI liest, werden nie in PetalBots Spur auftauchen.

Wir nehmen an, dass diese Daten für Citation Grounding verwendet würden.

Vielleicht. Vielleicht speisen sie stattdessen das Training. Vielleicht speisen sie etwas, das wir nicht benannt haben. Die Log-Daten können uns nicht sagen, welches davon, und wer Ihnen sagt, dass sie es können, rät mit mehr Zuversicht, als die Belege zulassen. Was die Logs belegen, ist eng und real: Eine Drittanbieter-Seite hat auf Sie verlinkt, und ein Crawler ist ihr gefolgt.

Es ist keine Messung von KI-Zitaten. Es ist ein First-Party-Proxy dafür, günstig aus Daten erstellt, die Sie bereits sammeln. Wir haben genau das für Kunden gebaut: einen First-Party-Datensatz von Zitationskandidaten von Dritten, gezogen aus ihren eigenen Logs. Spekulativ ist das Etikett, das wir auf den Graphen setzen, nicht der Graph selbst.

Mit WISLR arbeiten

Wir können Ihren Zitationskandidaten-Feed aus Ihren eigenen Logs erstellen.

WISLR liest KI-Crawler-Verhalten am Edge, pro URL und pro Tag, an Ihren First-Party-Daten. Dazu gehört, PetalBots Verweisspur in einen gerankten Feed der Drittanbieter-Seiten zu ziehen, die am wahrscheinlichsten prägen, was KI über Ihre Marke sagt, und ihn gegen die LLM-Crawler abzugleichen, die Ihre Website treffen.

See how AI Channel Analytics measures it →