Skip to main content
Carl, host of the WISLR crawl quiz

Tydzień od 3 sierpnia 2026

Kogo te boty próbują oszukać?

Większość tego, co pisze się o crawlerach AI, pochodzi z zapowiedzi dostawców, a nie z logów. Te pytania pochodzą z obu źródeł: z prawdziwych logów edge średniej wielkości sklepu ecommerce oraz z dokumentacji crawlerów, którą firmy AI publikują same. Odpowiedz na każde pytanie, a dowody pojawią się od razu.

Pytania
10
Minuty
6
  1. 1

    W minionym tygodniu który bot najczęściej pobierał /sitemap.xml?

    Bingbot od Microsoftu

    Bingbot pobrał go dziesiątki razy. Prawdziwe crawlery GPTBot, ClaudeBot, PerplexityBot i Gemini nie pobrały go ani razu, mimo że wysłały do tej samej witryny tysiące żądań. Crawlery AI w przeważającej większości odkrywają treści, podążając za linkami, a nie czytając sitemapy. Przesłanie sitemapy to rytuał wyszukiwarek: dla widoczności w AI daje bardzo niewiele, na ile wiemy.

  2. 2

    Czym jest Google-Extended?

    Tokenem w robots.txt, który decyduje, czy zebrane treści służą do trenowania Gemini i do ugruntowywania jego odpowiedzi

    Nigdy nie wysyła żadnego żądania. Google podaje, że Google-Extended nie ma własnego, odrębnego user-agenta, więc crawlowanie nadal odbywa się przez zwykłe crawlery Google, a token reguluje wyłącznie to, co dzieje się z tą treścią później: trenowanie przyszłych modeli Gemini oraz ugruntowywanie odpowiedzi w Gemini Apps i Vertex AI. Google mówi też wprost, że nie wpływa to na obecność witryny w Google Search ani nie jest sygnałem rankingowym, więc jego zablokowanie nic nie kosztuje w wyszukiwarce i nie zmniejszy ruchu crawlerów nawet o jedno żądanie.

  3. 3

    Jaki jest jedyny wiarygodny sposób potwierdzenia, że żądanie naprawdę pochodzi od GPTBot?

    Odwrotny DNS w połączeniu z opublikowanymi przez dostawcę zakresami IP

    Ciągi user-agent to zwykły tekst. Każdy może wysłać dowolny z nich i wiele skanerów właśnie tak robi.

  4. 4

    U typowego wydawcy która aktywność OpenAI generuje najwięcej żądań?

    ChatGPT-User pobierający stronę, bo człowiek o nią zapytał

    Pobrania inicjowane przez użytkownika przewyższyły crawle treningowe mniej więcej w stosunku sześć do jednego. Większość ruchu botów AI to nie trening, tylko pytanie prawdziwej osoby, na które odpowiedź powstaje w czasie rzeczywistym.

  5. 5

    Twoje logi pokazują ruch oznaczony jako OpenAI z adresu IP w Google Cloud. Jakie jest najbardziej prawdopodobne wyjaśnienie?

    Podszyty user-agent

    Zaobserwowaliśmy dokładnie taki przypadek: jeden skaner w pojedynczej sieci Google Cloud wysłał grubo ponad tysiąc żądań w ciągu 72 godzin, rotując user-agenty OpenAI, Perplexity i Gemini oraz odpytując po jednym adresie URL na ścieżkę. To enumeracja, a nie crawlowanie. Prawdziwe crawlery OpenAI wychodzą z Azure.

  6. 6

    Co najlepiej opisuje sposób, w jaki największe firmy AI crawlują sieć?

    Każda firma prowadzi kilka odrębnych botów o różnych zadaniach

    Własna dokumentacja OpenAI wymienia cztery: GPTBot do danych treningowych, ChatGPT-User do pobrania na żywo, gdy człowiek zadaje pytanie, OAI-SearchBot do wyników wyszukiwania w ChatGPT oraz OAI-AdsBot do sprawdzania stron zgłoszonych jako reklamy. Anthropic i pozostali stosują ten sam schemat. OpenAI podaje, że każde ustawienie jest niezależne, więc wydawca może wpuścić OAI-SearchBot, żeby pojawiać się w wynikach, a jednocześnie zablokować GPTBot. To znaczy, że pytanie „czy wpuszczać boty AI?” nie jest jedną decyzją, tylko czterema.

  7. 7

    Dodajesz User-agent: GPTBot z regułą Disallow: / do robots.txt. Co nadal dociera do twojej witryny?

    ChatGPT-User i OAI-SearchBot

    Zablokowanie jednego tokenu blokuje jednego bota. OpenAI podaje, że każde ustawienie jest niezależne, więc crawler wyszukiwania, crawler reklamowy i pobranie na żywo inicjowane przez użytkownika działają dalej. ChatGPT-User to przypadek najbardziej kłopotliwy: ponieważ te żądania inicjuje człowiek, a nie harmonogram crawlowania, OpenAI zaznacza, że reguły robots.txt mogą go w ogóle nie obejmować. Większość konfiguracji w stylu „zablokowaliśmy AI” zatrzymuje trening i zostawia zupełnie nietknięte te boty, które naprawdę napędzają odpowiedzi widziane przez użytkowników.

  8. 8

    Duży crawler odpytał news-sitemap.xml, sitemap.txt, sitemap.html i sitemap-index.xml, wszystkie z kodem 404, na witrynie, której robots.txt poprawnie deklaruje sitemapę. Co to pokazuje?

    Część crawlerów zgaduje nazwy plików sitemap metodą brute force, zamiast czytać dyrektywę Sitemap

    Crawler Meta robi dokładnie to. Poprawna linia Sitemap w robots.txt w niczym nie gwarantuje, że crawler z niej skorzysta.

  9. 9

    Odwiedzający zadaje pytanie ChatGPT, przechodzi na twoją stronę i coś kupuje. Dlaczego twoja analityka może nigdy nie przypisać tego ChatGPT?

    Wielu klientów AI nie wysyła żadnego odsyłacza, więc wizyta zapisuje się jako bezpośrednia

    Dane o odsyłaczach z asystentów AI są z założenia dziurawe. Aplikacje desktopowe i mobilne często w ogóle nie przekazują nagłówka referer, przeglądarki wbudowane w aplikacje zachowują się niespójnie, a część klientów wysyła jedynie samą domenę. Ruch ląduje w kanale bezpośrednim, obok zakładek i adresów wpisywanych ręcznie. Liczby po stronie odesłań to dolna granica, a nie pomiar.

  10. 10

    W typowym tygodniu jak wolumen crawlerów AI wypada na tle tradycyjnych crawlerów wyszukiwarek?

    Wyszukiwarki są nadal około 20 do 25 razy większe

    Google i Bing wykonały w ciągu 72 godzin grubo ponad sto tysięcy żądań, a wszystkie zweryfikowane crawlery AI razem wzięte kilka tysięcy. Crawlowanie przez AI rośnie i jest jak najbardziej realne, ale nie wyparło crawlowania wyszukiwarek, a nagłówki sugerujące inaczej zwykle liczą podszyte user-agenty.