Skip to main content
Carl, host of the WISLR crawl quiz

3 Ağustos 2026 haftası

Bu Botlar Kimi Kandırıyor?

Yapay zeka tarayıcıları hakkında yazılanların çoğu loglardan değil, sağlayıcı duyurularından geliyor. Bu sorular ikisinden birden geliyor: orta ölçekli bir e-ticaret sitesinin gerçek edge logları ve yapay zeka şirketlerinin kendi yayımladığı tarayıcı dokümantasyonu. Her soruyu yanıtlayın, kanıt hemen karşınıza çıksın.

Soru
10
Dakika
6
  1. 1

    Geçtiğimiz hafta /sitemap.xml dosyasını en sık hangi bot istedi?

    Microsoft'un Bingbot'u

    Bingbot dosyayı onlarca kez çekti. Gerçek GPTBot, ClaudeBot, PerplexityBot ve Gemini tarayıcıları, aynı siteye binlerce istek göndermelerine rağmen dosyayı hiç çekmedi. Yapay zeka tarayıcıları içeriği ezici çoğunlukla site haritalarını okuyarak değil, bağlantıları izleyerek keşfediyor. Site haritası göndermek bir arama motoru ritüelidir; bildiğimiz kadarıyla yapay zeka görünürlüğüne katkısı çok az.

  2. 2

    Google-Extended nedir?

    Taranan içeriğin Gemini'yi eğitip eğitmeyeceğini ve yanıtlarına dayanak olup olmayacağını denetleyen bir robots.txt jetonu

    Hiçbir zaman istek göndermez. Google, Google-Extended'in kendine ait ayrı bir user-agent'ı olmadığını belirtiyor; tarama yine normal Google tarayıcıları üzerinden gerçekleşiyor ve jeton yalnızca o içeriğe sonrasında ne olacağını yönetiyor: gelecekteki Gemini modellerinin eğitilmesi ve Gemini Apps ile Vertex AI içindeki yanıtlara dayanak sağlanması. Google ayrıca bunun bir sitenin Google Arama'da yer almasını etkilemediğini ve bir sıralama sinyali olmadığını açıkça söylüyor; dolayısıyla engellemek Arama tarafında hiçbir şeye mal olmaz ve tarama trafiğinizi tek bir istek bile azaltmaz.

  3. 3

    Bir isteğin gerçekten GPTBot'tan geldiğini doğrulamanın tek güvenilir yolu nedir?

    Ters DNS ve sağlayıcının yayımladığı IP aralıkları

    User-agent dizeleri serbest metindir. Herkes istediğini gönderebilir ve birçok tarama aracı da bunu yapıyor.

  4. 4

    Tipik bir yayıncı için OpenAI'ın hangi etkinliği en çok isteği üretir?

    Bir insan sorduğu için ChatGPT-User'ın bir sayfayı çekmesi

    Kullanıcı tarafından başlatılan çekimler, eğitim taramalarını yaklaşık altıya bir oranında geçti. Yapay zeka bot trafiğinin çoğu eğitim değildir; gerçek bir kişinin sorusunun anlık olarak yanıtlanmasıdır.

  5. 5

    Loglarınız bir Google Cloud IP adresinden gelen OpenAI etiketli trafik gösteriyor. En olası açıklama nedir?

    Sahte bir user-agent

    Tam olarak bunu yakaladık: tek bir Google Cloud ağındaki bir tarama aracı 72 saat içinde binin çok üzerinde istek gönderdi; OpenAI, Perplexity ve Gemini user-agent'ları arasında dönüşümlü geçiş yapıp her yol için tek bir URL'ye vurdu. Bu tarama değil, numaralandırmadır. Gerçek OpenAI tarayıcıları Azure üzerinden çıkış yapar.

  6. 6

    Büyük yapay zeka şirketlerinin web'i nasıl taradığını en iyi hangisi anlatır?

    Her şirket, farklı görevleri olan birden fazla ayrı bot çalıştırır

    OpenAI'ın kendi dokümantasyonu dört tane sayıyor: eğitim verisi için GPTBot, bir insan soru sorduğunda canlı çekim yapan ChatGPT-User, ChatGPT'nin arama sonuçları için OAI-SearchBot ve reklam olarak gönderilen sayfaları denetleyen OAI-AdsBot. Anthropic ve diğerleri de aynı düzeni izliyor. OpenAI her ayarın bağımsız olduğunu belirtiyor, yani bir yayıncı aramada görünmek için OAI-SearchBot'a izin verirken GPTBot'u engelleyebilir. Bu da "yapay zeka botlarına izin vermeli miyim?" sorusunun tek bir karar değil, dört karar olduğu anlamına gelir.

  7. 7

    robots.txt dosyanıza User-agent: GPTBot ve Disallow: / satırlarını ekliyorsunuz. Sitenize hâlâ ne ulaşır?

    ChatGPT-User ve OAI-SearchBot

    Bir jetonu engellemek bir botu engeller. OpenAI her ayarın bağımsız olduğunu belirtiyor, dolayısıyla arama tarayıcısı, reklam tarayıcısı ve kullanıcı kaynaklı canlı çekim çalışmaya devam eder. ChatGPT-User zor olanı: bu istekler bir tarama takvimi yerine bir kişi tarafından başlatıldığı için OpenAI, robots.txt kurallarının ona hiç uygulanmayabileceğini not düşüyor. "Yapay zekayı engelledik" yapılandırmalarının çoğu eğitimi durdurur ve kullanıcının gördüğü yanıtları asıl besleyen botlara hiç dokunmaz.

  8. 8

    Büyük bir tarayıcı, robots.txt dosyası site haritasını doğru biçimde bildiren bir sitede news-sitemap.xml, sitemap.txt, sitemap.html ve sitemap-index.xml istedi, hepsi 404 döndü. Bu ne gösterir?

    Bazı tarayıcılar Sitemap yönergesini okumak yerine site haritası dosya adlarını kaba kuvvetle tahmin eder

    Meta'nın tarayıcısı tam olarak bunu yapıyor. robots.txt içindeki doğru bir Sitemap satırı, bir tarayıcının onu kullanacağının garantisi değildir.

  9. 9

    Bir ziyaretçi ChatGPT'ye soru soruyor, sitenize tıklıyor ve bir şey satın alıyor. Analitiğiniz neden ChatGPT'yi hiçbir zaman kaynak olarak göstermeyebilir?

    Birçok yapay zeka istemcisi referrer göndermez, bu yüzden ziyaret doğrudan trafik olarak kaydedilir

    Yapay zeka asistanlarından gelen referrer verisi tasarımı gereği eksiktir. Masaüstü ve mobil uygulamalar çoğu zaman hiç referer başlığı geçirmez, uygulama içi tarayıcılar tutarsız davranır ve bazı istemciler yalnızca çıplak bir alan adı gönderir. Trafik, yer imleri ve elle yazılan URL'lerle birlikte doğrudan trafiğe düşer. Referral tarafındaki rakamlar bir ölçüm değil, bir alt sınırdır.

  10. 10

    Tipik bir haftada yapay zeka tarayıcı hacmi, geleneksel arama tarayıcısı hacmiyle nasıl kıyaslanır?

    Arama hâlâ yaklaşık 20 ila 25 kat daha büyük

    Google ve Bing 72 saat içinde yüz binin çok üzerinde istek yaptı; doğrulanmış tüm yapay zeka tarayıcıları toplamda birkaç bin istek yaptı. Yapay zeka taraması büyüyor ve gerçek, ancak arama taramasının yerini almadı; aksini ima eden başlıklar genellikle sahte user-agent'ları sayıyor.