Skip to main content

Log pelayan anda menamakan halaman pihak ketiga yang mengajar AI tentang jenama anda.

Apabila alat AI seperti ChatGPT mempelajari jenama anda, ia sering bermula daripada laman web lain yang menyebut anda: ulasan, benang forum, artikel perbandingan. Setiap kali AI crawler mengikut pautan dari salah satu halaman itu ke halaman anda, pelayan anda merekodkannya. Masalahnya, kebanyakan AI crawler tidak memberitahu dari halaman mana mereka datang. Satu crawler, PetalBot, memberitahu. Ia melaporkan halaman luar tepat yang memaut kepada anda, setiap kali. Itu memberi anda senarai berjalan, dibina daripada rekod yang anda sudah simpan, tentang halaman yang paling mungkin membentuk apa yang AI katakan tentang jenama anda. Panduan ini menerangkan cara ia berfungsi, cara membina senarai itu sendiri, dan apa yang boleh serta tidak boleh dibuktikannya.

Forensik crawler: PetalBot mendedahkan halaman pihak ketiga yang paling mungkin membekalkan petikan AI tentang jenama anda
Hipotesis
  1. AI crawlers reach you by following backlinks, and that leaves a footprint. GPTBot and others do not only crawl your sitemap. They also arrive by following a link from a third-party page that mentions your brand: a forum thread, a comparison article, a review. That link-following happens in real time and lands in your server logs, timestamped and fresh.
  2. Most crawlers hide where they came from. PetalBot does not. Nearly every LLM crawler fetches your pages without saying which page sent it. PetalBot does the opposite: it reports the exact referring URL on its hits. That single behavior turns a log line into a source citation.
  3. PetalBot and the LLM crawlers largely read the same web. So when PetalBot hands you a referring URL, it is pointing at a page the AI crawlers are plausibly reading too. Pull those URLs and you have a first-party shortlist of the third-party pages most likely shaping what AI says about your brand.
  4. The overlap with AI crawlers is inferred, not confirmed. We can see PetalBot's path. We cannot see OpenAI's. Whether this data feeds citation grounding or model training is something the logs cannot tell us either. The method is useful anyway, and its limits are spelled out below.

Satu hipotesis forensik-crawler. Log pelayan anda sudah menyimpan indeks kasar bagi halaman pihak ketiga yang paling mungkin membekalkan apa yang AI katakan tentang jenama anda. Anda hampir pasti sedang mengumpul data itu dan membuang isyaratnya.

Kebanyakan orang membayangkan AI crawler seperti mereka membayangkan Googlebot: ia membaca sitemap anda, menyusuri pautan dalaman anda, dan mengindeks halaman anda. Itu memang berlaku. Tetapi itu bukan satu-satunya cara GPTBot dan yang lain sampai kepada anda.

Mereka juga tiba dengan mengikut backlink: benang forum yang membandingkan anda dengan pesaing, ulasan di laman yang anda tidak pernah dengar, artikel himpunan yang memaut ke halaman produk anda. Apabila AI crawler mengikut salah satu pautan itu, ia berlaku hampir masa nyata dan mendarat dalam access log anda dengan cap masa.

Setiap ikutan pautan merekodkan satu fakta yang boleh anda tindak. Sebuah halaman pihak ketiga menyebut anda, dan sebuah crawler menyusuri pautan itu untuk sampai kepada anda.

Cara lazim untuk mengetahui halaman pihak ketiga mana yang membentuk jawapan AI ialah dengan menggesa ChatGPT, Perplexity dan selebihnya lalu mengikis sumber daripada JSON yang mereka pulangkan. Itu berkesan, dan anda patut melakukannya. Tetapi ia melihat masalah dari luar, satu gesaan pada satu masa. Log anda sendiri membolehkan anda melihat dari dalam, secara berterusan, pada data yang tiada sesiapa boleh had-kadar atau ambil daripada anda.

Most Crawlers Will Not Tell You Where They Came From

Ikutan backlink hanya berguna jika crawler memberitahu anda halaman mana yang diikutinya, dan itu terletak di satu tempat: Referer header yang dihantar crawler bersama permintaannya.

Hampir tiada satu pun LLM crawler menghantarnya. Mereka mengambil halaman anda dan tidak merekodkan apa-apa tentang dari mana mereka datang. Anda nampak lawatan itu. Anda tidak nampak sumbernya.

CrawlerMelaporkan halaman perujuk?
GPTBotTiada perujuk dilaporkan
ClaudeBotTiada perujuk dilaporkan
PerplexityBotTiada perujuk dilaporkan
BingbotTiada perujuk dilaporkan
PetalBotMelaporkan URL perujuk penuh

Jadi kebanyakan crawl yang anda pentingkan adalah tanpa nama pada sumbernya. Anda boleh membuktikan bot AI melawat. Anda tidak boleh membuktikan apa yang menghantarnya. Satu crawler merapatkan jurang itu.

PetalBot Is the Exception

PetalBot ialah crawler di sebalik Petal Search milik Huawei. Ia bukan bot sesebuah makmal AI. Tetapi ia melakukan satu perkara yang hampir tiada apa-apa lain lakukan: pada permintaannya, ia melaporkan URL perujuk. Halaman pihak ketiga tepat yang diikutinya untuk sampai ke halaman anda, query string dan semuanya.

Dalam log kami, tingkah laku itu bukan sesekala. Ia adalah kelaziman.

100%
daripada hits PetalBot yang kami periksa membawa URL pemetik penuh
Query string dikekalkan
perujuk tiba utuh, tidak dilucutkan kepada domain kosong

Satu baris log PetalBot merapatkan jurang. Hit AI-crawler biasa memberitahu anda sebuah bot tiba. Hit PetalBot memberitahu anda sebuah bot tiba dan menamakan halaman yang menghantarnya.

Satu permintaan PetalBot tunggal, beranotasi
203.0.113.x - - [20/Jul/2026:14:22:07 +0000] "GET /products/widget-pro HTTP/1.1" 200 18244 "https://forum.example.com/thread/best-widgets-2026?sort=top" "PetalBot"
PerujukHalaman pihak ketiga yang PetalBot ikuti untuk sampai kepada anda. Inilah citation candidate. Query string dikekalkan, jadi anda mendarat pada paparan tepat, bukan tekaan.
Cap masaBila pautan itu disusuri. Perujuk terkini lebih penting daripada yang lama: halaman yang di-crawl hari ini ialah halaman yang beredar hari ini.
SasaranHalaman anda yang mana dipaut oleh laman pihak ketiga itu. Itu memberitahu anda apa tentang jenama anda yang sedang dibincangkan di tempat lain.

Kami juga menyenaraikan PetalBot antara crawler yang lebih sopan yang kami lihat, diukur mengikut permintaan puncak seminit dalam log kami. Ia tidak menghentam origin anda. Terdapat sedikit sahaja kos operasi untuk membiarkannya, dan kos isyarat yang nyata jika menyekatnya.

Jangan sekat PetalBot. Menyekatnya ialah satu tindakan yang membuang keseluruhan isyarat ini.

PetalBot and the LLM Crawlers Read the Same Web

Langkah seterusnya ialah tempat kaedah ini berhenti menjadi pemerhatian dan menjadi inferens.

PetalBot dan LLM crawler sebahagian besarnya membaca web yang sama. Mereka mengikut pautan yang sama, dari laman ulasan, forum dan artikel perbandingan yang sama, kerana di situlah sebutan tentang jenama anda berada. Jadi apabila PetalBot menyerahkan URL perujuk kepada anda, ia sedang menunjuk ke halaman yang AI crawler berkemungkinan juga membacanya.

PetalBot melaporkan perujuknya dan LLM crawler tidak. Gunakan apa yang dilaporkannya sebagai pengganti bagi apa yang mereka sembunyikan.

Halaman pihak ketiga
Sebuah ulasan, benang forum atau artikel perbandingan yang menyebut jenama anda dan memaut kepada anda.
PetalBot mengikut pautan
dan merekodkan URL perujuk dalam access log anda, bercap masa dan lengkap.
LLM crawler berkemungkinan mengikutinya juga
membaca halaman yang sama atas sebab yang sama. Langkah ini diinferens, bukan diperhati.

Tekniknya ialah triangulasi. Anda tidak boleh melihat sasaran secara langsung, jadi anda mengukur sesuatu yang bergerak seiring dengannya. Di sini, benda yang boleh diukur ialah jejak rujukan PetalBot, yang berada dalam fail log yang anda sudah miliki.

Build the Graph: From Raw Logs to a Citation Shortlist

Tiada satu pun daripada ini memerlukan alat baharu. Ia memerlukan log yang anda sudah kumpul dan beberapa langkah penapisan.

1

Log di edge, dan kekalkan Referer header

Tangkap permintaan di pelayan atau CDN, bukan dalam tag JavaScript, kerana crawler tidak menjalankan tag itu. Satu medan yang keseluruhan kaedah ini bergantung padanya ialah Referer. Jika pengelogan anda melucutkannya, atau memotong query string, betulkan itu dahulu. Anda tidak boleh memulihkan header yang tidak pernah anda simpan.

2

Tapis kepada hits PetalBot yang membawa perujuk pihak ketiga

Padankan user-agent PetalBot, kemudian kekalkan hanya hits yang perujuknya menunjuk ke domain yang bukan milik anda. Perujuk luar-laman itu ialah citation candidate anda. Buang rujukan-kendiri dan perujuk kosong; ia hingar bagi tujuan ini.

3

Nyahduakan kepada halaman, kemudian himpunkan kepada domain

Benang forum yang sama akan muncul banyak kali. Runtuhkan URL berulang menjadi halaman unik, kemudian kumpulkan halaman di bawah domainnya. Kini anda mempunyai dua paparan: halaman individu yang memaut kepada anda, dan laman tempat halaman itu berada.

4

Timbangkan mengikut keterkinian dan pengulangan

Perujuk yang dilihat lima puluh kali minggu ini mengatasi yang dilihat sekali suku lalu. Timbangkan setiap candidate mengikut berapa kerap ia berulang dan sejauh mana ia baru-baru ini disusuri. Keterkinian ialah separuh yang penting: halaman yang di-crawl sekarang ialah halaman yang beredar sekarang.

5

Silang rujuk dengan LLM crawler pada halaman anda sendiri

Sejajarkan masanya. Apabila rujukan PetalBot menunjuk ke halaman produk anda, semak sama ada GPTBot, ClaudeBot atau yang lain menghentam halaman yang sama itu dalam tetingkap yang sama. Pertindihan masa mengukuhkan hujah bahawa halaman pihak ketiga itu ialah sebahagian daripada apa yang AI sedang baca tentang anda pada masa ini.

6

Peringkatkannya, dan anggapnya sebagai shortlist

Apa yang terhasil ialah senarai berperingkat bagi halaman dan domain pihak ketiga yang paling mungkin membekalkan jawapan AI tentang jenama anda, dibina sepenuhnya daripada first-party data. Anggapnya sebagai senarai petunjuk untuk disiasat, bukan set petikan yang terbukti.

Atau langkau saluran paip

Langkah 1 hingga 6 ialah tepat apa yang WISLR.ai jalankan untuk anda. Ia menangkap aktiviti AI crawler dan PetalBot di edge, mengekalkan perujuk, dan menukarkannya menjadi suapan berperingkat yang sentiasa terkini bagi halaman pihak ketiga yang paling mungkin membentuk apa yang AI katakan tentang jenama anda, disilang rujuk dengan LLM crawler yang menghentam laman anda sendiri. Tiada perlu bergelut dengan log.

Build it with WISLR.ai →

What the Graph Is Good For

Suapan berperingkat bagi halaman yang bercakap tentang anda, disegarkan secara berterusan, berguna sama ada hipotesis pengasasan-AI benar atau tidak.

Betulkan maklumat salah pada sumbernya. Jika sebuah halaman dalam suapan rujukan anda mengatakan sesuatu yang salah tentang jenama anda, dan ia di-crawl cukup kerap untuk muncul, kini anda tahu tepat di mana untuk membalas. Anda tidak lagi meneka laman mana antara seribu laman yang penting. Crawler memberitahu anda yang mana sedang beredar.

Temui sebutan yang anda tidak tahu wujud. Kebanyakan pemantauan jenama memerhatikan senarai yang anda bina. Ini memerhatikan senarai yang web bina, dan menyerahkan kepada anda ulasan, benang dan halaman perbandingan yang tidak pernah anda jejaki, terus daripada access log anda sendiri.

Jika hipotesis pengasasan-AI tidak pernah benar, anda masih mempunyai suapan pemantauan-jenama yang dibina daripada data yang anda sudah kumpul. Jika ia benar, anda mempunyai peta tempat AI sedang belajar tentang anda.

What We Are Assuming, and What We Cannot See

Dua andaian mendasari kaedah ini, dan tiada satu pun yang disahkan. Ia berbaloi digunakan juga, tetapi hanya jika anda tahu di mana ia berhenti.

Kami andaikan PetalBot dan LLM crawler mengikut pautan yang sama.

Kami boleh melihat laluan PetalBot. Kami tidak boleh melihat laluan OpenAI. Pertindihan itu ialah taruhan yang munasabah, kerana kedua-duanya meng-crawl web terbuka tempat sebutan jenama berada, tetapi ia tetap satu taruhan. Sebahagian perujuk PetalBot akan menjadi halaman yang tiada AI crawler pernah baca, dan sebahagian halaman yang AI baca tidak akan pernah muncul dalam jejak PetalBot.

Kami andaikan data ini akan digunakan untuk citation grounding.

Mungkin. Ia mungkin membekalkan latihan sebaliknya. Ia mungkin membekalkan sesuatu yang belum kami namakan. Data log tidak boleh memberitahu kami yang mana, dan sesiapa yang memberitahu anda ia boleh sedang meneka dengan lebih keyakinan daripada yang bukti benarkan. Apa yang log buktikan adalah sempit dan nyata: sebuah halaman pihak ketiga memaut kepada anda, dan sebuah crawler mengikutinya.

Ia bukan pengukuran petikan AI. Ia proksi first-party bagi petikan itu, dibina dengan murah daripada data yang anda sudah kumpul. Kami telah membina tepat perkara ini untuk pelanggan: satu dataset first-party bagi citation candidate pihak ketiga, ditarik daripada log mereka sendiri. Apa yang bersifat spekulasi ialah label yang kami letak pada graf itu, bukan graf itu sendiri.

Bekerjasama dengan WISLR

Kami boleh membina suapan citation-candidate anda daripada log anda sendiri.

WISLR membaca tingkah laku AI crawler di edge, per URL dan per hari, pada first-party data anda. Itu termasuk menarik jejak rujukan PetalBot ke dalam suapan berperingkat bagi halaman pihak ketiga yang paling mungkin membentuk apa yang AI katakan tentang jenama anda, dan menyilang rujuknya dengan LLM crawler yang menghentam laman anda.

See how AI Channel Analytics measures it →