AI Crawlers Also Reach You by Following Backlinks
Satu hipotesis forensik-crawler. Log pelayan anda sudah menyimpan indeks kasar bagi halaman pihak ketiga yang paling mungkin membekalkan apa yang AI katakan tentang jenama anda. Anda hampir pasti sedang mengumpul data itu dan membuang isyaratnya.
Kebanyakan orang membayangkan AI crawler seperti mereka membayangkan Googlebot: ia membaca sitemap anda, menyusuri pautan dalaman anda, dan mengindeks halaman anda. Itu memang berlaku. Tetapi itu bukan satu-satunya cara GPTBot dan yang lain sampai kepada anda.
Mereka juga tiba dengan mengikut backlink: benang forum yang membandingkan anda dengan pesaing, ulasan di laman yang anda tidak pernah dengar, artikel himpunan yang memaut ke halaman produk anda. Apabila AI crawler mengikut salah satu pautan itu, ia berlaku hampir masa nyata dan mendarat dalam access log anda dengan cap masa.
Cara lazim untuk mengetahui halaman pihak ketiga mana yang membentuk jawapan AI ialah dengan menggesa ChatGPT, Perplexity dan selebihnya lalu mengikis sumber daripada JSON yang mereka pulangkan. Itu berkesan, dan anda patut melakukannya. Tetapi ia melihat masalah dari luar, satu gesaan pada satu masa. Log anda sendiri membolehkan anda melihat dari dalam, secara berterusan, pada data yang tiada sesiapa boleh had-kadar atau ambil daripada anda.
Most Crawlers Will Not Tell You Where They Came From
Ikutan backlink hanya berguna jika crawler memberitahu anda halaman mana yang diikutinya, dan itu terletak di satu tempat: Referer header yang dihantar crawler bersama permintaannya.
Hampir tiada satu pun LLM crawler menghantarnya. Mereka mengambil halaman anda dan tidak merekodkan apa-apa tentang dari mana mereka datang. Anda nampak lawatan itu. Anda tidak nampak sumbernya.
Jadi kebanyakan crawl yang anda pentingkan adalah tanpa nama pada sumbernya. Anda boleh membuktikan bot AI melawat. Anda tidak boleh membuktikan apa yang menghantarnya. Satu crawler merapatkan jurang itu.
PetalBot Is the Exception
PetalBot ialah crawler di sebalik Petal Search milik Huawei. Ia bukan bot sesebuah makmal AI. Tetapi ia melakukan satu perkara yang hampir tiada apa-apa lain lakukan: pada permintaannya, ia melaporkan URL perujuk. Halaman pihak ketiga tepat yang diikutinya untuk sampai ke halaman anda, query string dan semuanya.
Dalam log kami, tingkah laku itu bukan sesekala. Ia adalah kelaziman.
Satu baris log PetalBot merapatkan jurang. Hit AI-crawler biasa memberitahu anda sebuah bot tiba. Hit PetalBot memberitahu anda sebuah bot tiba dan menamakan halaman yang menghantarnya.
203.0.113.x - - [20/Jul/2026:14:22:07 +0000] "GET /products/widget-pro HTTP/1.1" 200 18244 "https://forum.example.com/thread/best-widgets-2026?sort=top" "PetalBot"
Kami juga menyenaraikan PetalBot antara crawler yang lebih sopan yang kami lihat, diukur mengikut permintaan puncak seminit dalam log kami. Ia tidak menghentam origin anda. Terdapat sedikit sahaja kos operasi untuk membiarkannya, dan kos isyarat yang nyata jika menyekatnya.
PetalBot and the LLM Crawlers Read the Same Web
Langkah seterusnya ialah tempat kaedah ini berhenti menjadi pemerhatian dan menjadi inferens.
PetalBot dan LLM crawler sebahagian besarnya membaca web yang sama. Mereka mengikut pautan yang sama, dari laman ulasan, forum dan artikel perbandingan yang sama, kerana di situlah sebutan tentang jenama anda berada. Jadi apabila PetalBot menyerahkan URL perujuk kepada anda, ia sedang menunjuk ke halaman yang AI crawler berkemungkinan juga membacanya.
PetalBot melaporkan perujuknya dan LLM crawler tidak. Gunakan apa yang dilaporkannya sebagai pengganti bagi apa yang mereka sembunyikan.
Tekniknya ialah triangulasi. Anda tidak boleh melihat sasaran secara langsung, jadi anda mengukur sesuatu yang bergerak seiring dengannya. Di sini, benda yang boleh diukur ialah jejak rujukan PetalBot, yang berada dalam fail log yang anda sudah miliki.
Build the Graph: From Raw Logs to a Citation Shortlist
Tiada satu pun daripada ini memerlukan alat baharu. Ia memerlukan log yang anda sudah kumpul dan beberapa langkah penapisan.
Log di edge, dan kekalkan Referer header
Tangkap permintaan di pelayan atau CDN, bukan dalam tag JavaScript, kerana crawler tidak menjalankan tag itu. Satu medan yang keseluruhan kaedah ini bergantung padanya ialah Referer. Jika pengelogan anda melucutkannya, atau memotong query string, betulkan itu dahulu. Anda tidak boleh memulihkan header yang tidak pernah anda simpan.
Tapis kepada hits PetalBot yang membawa perujuk pihak ketiga
Padankan user-agent PetalBot, kemudian kekalkan hanya hits yang perujuknya menunjuk ke domain yang bukan milik anda. Perujuk luar-laman itu ialah citation candidate anda. Buang rujukan-kendiri dan perujuk kosong; ia hingar bagi tujuan ini.
Nyahduakan kepada halaman, kemudian himpunkan kepada domain
Benang forum yang sama akan muncul banyak kali. Runtuhkan URL berulang menjadi halaman unik, kemudian kumpulkan halaman di bawah domainnya. Kini anda mempunyai dua paparan: halaman individu yang memaut kepada anda, dan laman tempat halaman itu berada.
Timbangkan mengikut keterkinian dan pengulangan
Perujuk yang dilihat lima puluh kali minggu ini mengatasi yang dilihat sekali suku lalu. Timbangkan setiap candidate mengikut berapa kerap ia berulang dan sejauh mana ia baru-baru ini disusuri. Keterkinian ialah separuh yang penting: halaman yang di-crawl sekarang ialah halaman yang beredar sekarang.
Silang rujuk dengan LLM crawler pada halaman anda sendiri
Sejajarkan masanya. Apabila rujukan PetalBot menunjuk ke halaman produk anda, semak sama ada GPTBot, ClaudeBot atau yang lain menghentam halaman yang sama itu dalam tetingkap yang sama. Pertindihan masa mengukuhkan hujah bahawa halaman pihak ketiga itu ialah sebahagian daripada apa yang AI sedang baca tentang anda pada masa ini.
Peringkatkannya, dan anggapnya sebagai shortlist
Apa yang terhasil ialah senarai berperingkat bagi halaman dan domain pihak ketiga yang paling mungkin membekalkan jawapan AI tentang jenama anda, dibina sepenuhnya daripada first-party data. Anggapnya sebagai senarai petunjuk untuk disiasat, bukan set petikan yang terbukti.
Langkah 1 hingga 6 ialah tepat apa yang WISLR.ai jalankan untuk anda. Ia menangkap aktiviti AI crawler dan PetalBot di edge, mengekalkan perujuk, dan menukarkannya menjadi suapan berperingkat yang sentiasa terkini bagi halaman pihak ketiga yang paling mungkin membentuk apa yang AI katakan tentang jenama anda, disilang rujuk dengan LLM crawler yang menghentam laman anda sendiri. Tiada perlu bergelut dengan log.
What the Graph Is Good For
Suapan berperingkat bagi halaman yang bercakap tentang anda, disegarkan secara berterusan, berguna sama ada hipotesis pengasasan-AI benar atau tidak.
Betulkan maklumat salah pada sumbernya. Jika sebuah halaman dalam suapan rujukan anda mengatakan sesuatu yang salah tentang jenama anda, dan ia di-crawl cukup kerap untuk muncul, kini anda tahu tepat di mana untuk membalas. Anda tidak lagi meneka laman mana antara seribu laman yang penting. Crawler memberitahu anda yang mana sedang beredar.
Temui sebutan yang anda tidak tahu wujud. Kebanyakan pemantauan jenama memerhatikan senarai yang anda bina. Ini memerhatikan senarai yang web bina, dan menyerahkan kepada anda ulasan, benang dan halaman perbandingan yang tidak pernah anda jejaki, terus daripada access log anda sendiri.
What We Are Assuming, and What We Cannot See
Dua andaian mendasari kaedah ini, dan tiada satu pun yang disahkan. Ia berbaloi digunakan juga, tetapi hanya jika anda tahu di mana ia berhenti.
Kami boleh melihat laluan PetalBot. Kami tidak boleh melihat laluan OpenAI. Pertindihan itu ialah taruhan yang munasabah, kerana kedua-duanya meng-crawl web terbuka tempat sebutan jenama berada, tetapi ia tetap satu taruhan. Sebahagian perujuk PetalBot akan menjadi halaman yang tiada AI crawler pernah baca, dan sebahagian halaman yang AI baca tidak akan pernah muncul dalam jejak PetalBot.
Mungkin. Ia mungkin membekalkan latihan sebaliknya. Ia mungkin membekalkan sesuatu yang belum kami namakan. Data log tidak boleh memberitahu kami yang mana, dan sesiapa yang memberitahu anda ia boleh sedang meneka dengan lebih keyakinan daripada yang bukti benarkan. Apa yang log buktikan adalah sempit dan nyata: sebuah halaman pihak ketiga memaut kepada anda, dan sebuah crawler mengikutinya.
Ia bukan pengukuran petikan AI. Ia proksi first-party bagi petikan itu, dibina dengan murah daripada data yang anda sudah kumpul. Kami telah membina tepat perkara ini untuk pelanggan: satu dataset first-party bagi citation candidate pihak ketiga, ditarik daripada log mereka sendiri. Apa yang bersifat spekulasi ialah label yang kami letak pada graf itu, bukan graf itu sendiri.
Kami boleh membina suapan citation-candidate anda daripada log anda sendiri.
WISLR membaca tingkah laku AI crawler di edge, per URL dan per hari, pada first-party data anda. Itu termasuk menarik jejak rujukan PetalBot ke dalam suapan berperingkat bagi halaman pihak ketiga yang paling mungkin membentuk apa yang AI katakan tentang jenama anda, dan menyilang rujuknya dengan LLM crawler yang menghentam laman anda.