Skip to main content
Carl, host of the WISLR crawl quiz

Minggu 3 Ogos 2026

Bot Ini Nak Tipu Siapa?

Kebanyakan tulisan tentang perangkak AI berasal daripada pengumuman vendor dan bukan daripada log. Soalan di sini datang daripada kedua-duanya: log edge sebenar sebuah tapak ecommerce bersaiz sederhana, dan dokumentasi perangkak yang diterbitkan sendiri oleh syarikat AI. Jawab setiap satu dan buktinya muncul serta-merta.

Soalan
10
Minit
6
  1. 1

    Dalam seminggu yang lalu, bot manakah yang paling kerap meminta /sitemap.xml?

    Bingbot daripada Microsoft

    Bingbot mengambilnya berpuluh-puluh kali. Perangkak GPTBot, ClaudeBot, PerplexityBot dan Gemini yang sebenar mengambilnya sifar kali, walaupun menghantar ribuan permintaan ke tapak yang sama. Perangkak AI sebahagian besarnya menemui kandungan dengan mengikut pautan, bukan dengan membaca sitemap. Menghantar sitemap ialah ritual enjin carian; setakat yang kami tahu, ia hampir tidak membantu keterlihatan AI.

  2. 2

    Apakah itu Google-Extended?

    Token robots.txt yang mengawal sama ada kandungan yang dirangkak digunakan untuk melatih Gemini dan melandaskan jawapannya

    Ia tidak pernah menghantar sebarang permintaan. Google menyatakan bahawa Google-Extended tidak mempunyai user-agent tersendiri, jadi perangkakan tetap berlaku melalui perangkak Google yang biasa dan token itu hanya mengawal apa yang berlaku kepada kandungan tersebut selepas itu: melatih model Gemini masa hadapan, dan melandaskan jawapan dalam Gemini Apps dan Vertex AI. Google juga menegaskan bahawa ia tidak menjejaskan kemasukan sesebuah tapak dalam carian Google dan ia bukan isyarat kedudukan, jadi menyekatnya tidak merugikan apa-apa dari segi carian dan tidak akan mengurangkan trafik perangkakan anda walaupun satu permintaan.

  3. 3

    Apakah satu-satunya cara yang boleh dipercayai untuk mengesahkan bahawa sesuatu permintaan benar-benar datang daripada GPTBot?

    DNS songsang bersama julat IP yang diterbitkan oleh vendor

    Rentetan user-agent ialah teks bebas. Sesiapa sahaja boleh menghantar apa jua rentetan, dan banyak pengimbas memang berbuat demikian.

  4. 4

    Bagi penerbit biasa, aktiviti OpenAI yang manakah menjana paling banyak permintaan?

    ChatGPT-User mengambil halaman kerana seorang manusia bertanya mengenainya

    Pengambilan yang dimulakan oleh pengguna mengatasi perangkakan latihan dengan nisbah kira-kira enam berbanding satu. Kebanyakan trafik bot AI bukan latihan, tetapi soalan orang sebenar yang sedang dijawab pada masa nyata.

  5. 5

    Log anda menunjukkan trafik berlabel OpenAI daripada satu IP Google Cloud. Apakah penjelasan yang paling mungkin?

    User-agent yang dipalsukan

    Kami menangkap situasi yang tepat seperti ini: satu pengimbas pada satu rangkaian Google Cloud menghantar jauh melebihi seribu permintaan dalam 72 jam, berselang-seli antara user-agent OpenAI, Perplexity dan Gemini, serta menyentuh satu URL bagi setiap laluan. Itu penghitungan, bukan perangkakan. Perangkak OpenAI yang sebenar keluar melalui Azure.

  6. 6

    Manakah yang paling tepat menggambarkan cara syarikat AI utama merangkak web?

    Setiap syarikat menjalankan beberapa bot berasingan dengan tugas yang berbeza

    Dokumentasi OpenAI sendiri menyenaraikan empat: GPTBot untuk data latihan, ChatGPT-User untuk pengambilan langsung apabila seorang manusia bertanya, OAI-SearchBot untuk hasil carian ChatGPT, dan OAI-AdsBot untuk memeriksa halaman yang dihantar sebagai iklan. Anthropic dan yang lain mengikut corak yang sama. OpenAI menyatakan bahawa setiap tetapan adalah bebas, jadi seorang penerbit boleh membenarkan OAI-SearchBot supaya muncul dalam carian sambil menyekat GPTBot. Ini bermakna "patutkah saya benarkan bot AI?" bukan satu keputusan, tetapi empat.

  7. 7

    Anda menambah User-agent: GPTBot dengan Disallow: / dalam robots.txt. Apakah yang masih sampai ke tapak anda?

    ChatGPT-User dan OAI-SearchBot

    Menyekat satu token hanya menyekat satu bot. OpenAI menyatakan bahawa setiap tetapan adalah bebas, jadi perangkak carian, perangkak iklan dan pengambilan langsung oleh pengguna semuanya terus berjalan. ChatGPT-User ialah kes yang paling janggal: kerana permintaan itu dimulakan oleh seseorang dan bukan oleh jadual perangkakan, OpenAI menyatakan bahawa peraturan robots.txt mungkin langsung tidak terpakai kepadanya. Kebanyakan konfigurasi "kami sudah sekat AI" hanya menghentikan latihan dan membiarkan bot yang benar-benar memacu jawapan yang dilihat pengguna terus berjalan tanpa sebarang sekatan.

  8. 8

    Sebuah perangkak utama meminta news-sitemap.xml, sitemap.txt, sitemap.html dan sitemap-index.xml, kesemuanya 404, pada sebuah tapak yang robots.txt-nya mengisytiharkan sitemapnya dengan betul. Apakah yang ditunjukkan oleh keadaan ini?

    Sesetengah perangkak meneka nama fail sitemap secara paksa dan bukannya membaca arahan Sitemap

    Perangkak Meta memang berbuat begini. Baris Sitemap yang betul dalam robots.txt bukan jaminan bahawa sesebuah perangkak akan menggunakannya.

  9. 9

    Seorang pelawat bertanya sesuatu kepada ChatGPT, klik ke tapak anda, dan membeli sesuatu. Mengapa platform analitis anda mungkin tidak pernah mengkreditkan ChatGPT?

    Banyak klien AI tidak menghantar perujuk, jadi lawatan itu direkodkan sebagai trafik langsung

    Data perujuk daripada pembantu AI memang tidak lengkap secara reka bentuk. Aplikasi desktop dan mudah alih kerap tidak menghantar pengepala referer langsung, pelayar dalam aplikasi bertindak secara tidak konsisten, dan sesetengah klien hanya menghantar nama domain kosong. Trafik itu mendarat dalam kategori langsung, bersama penanda halaman dan URL yang ditaip. Angka di sebelah rujukan ialah paras minimum, bukan satu pengukuran.

  10. 10

    Dalam minggu biasa, bagaimanakah jumlah perangkakan AI berbanding jumlah perangkakan enjin carian tradisional?

    Carian masih kira-kira 20 hingga 25 kali lebih besar

    Google dan Bing bersama-sama membuat jauh melebihi seratus ribu permintaan dalam 72 jam; kesemua perangkak AI yang disahkan pula membuat beberapa ribu. Perangkakan AI sedang berkembang dan ia nyata, tetapi ia belum menggantikan perangkakan carian, dan tajuk berita yang mengesyorkan sebaliknya biasanya sedang mengira user-agent yang dipalsukan.