Skip to main content

Opublikowaliśmy 20 wniosków o botach AI. Sześć miesięcy później zmieniło się 65%.

W marcu 2026 opublikowaliśmy 20 wniosków o zachowaniu botów AI na podstawie 48 dni logów serwera. Przetestowaliśmy je ponownie na sześciu miesiącach logów: 11 z 17 możliwych do weryfikacji wniosków zmieniło się, czyli 65% listy, w około pięć miesięcy. Sześć zdezaktualizowały nowe zachowania crawlerów, pięć przesunęło się istotnie, a sześć nadal jest aktualnych. Meta w osiem tygodni przeszła od zupełnej nieobecności do roli najcięższego crawlera AI, odcisk IP ChatGPT-User odwrócił się, llms.txt jest dziś pobierany nieustannie, ale niemal wyłącznie przez skanery, a nie przez czołowe laboratoria, a Bytespider okazał się trzecim najcięższym crawlerem, a nie turystą od robots.txt.

Sześć miesięcy logów serwera z botami AI weryfikujących dwadzieścia wcześniejszych wniosków o GPTBot, ChatGPT-User, ClaudeBot, meta-externalagent i Bytespider
Sześć miesięcy logów serwera z botami AI weryfikujących dwadzieścia wcześniejszych wniosków o GPTBot, ChatGPT-User, ClaudeBot, meta-externalagent i Bytespider
Co się zmieniło
  1. 55% of what we published had changed within five months. Jedenaście z siedemnastu ponownie przetestowanych wniosków ruszyło z miejsca: sześć zdezaktualizowały nowe zachowania crawlerów, pięć przesunęło się istotnie. Sześć nadal jest aktualnych. Test powtórzono na trzech serwisach między 1 lutego a 13 lipca 2026, a każdy wniosek ma poniżej przypisany werdykt.
  2. Rankings churn. Behaviours do not. Crawlowanie zrywami, skoordynowane akcje dostawców i przewaga treści technicznych przetrwały dłuższe okno pomiarowe. Każda konkretna nazwa bota, każdy współczynnik i każda godzina szczytu, które opublikowaliśmy, uległy zmianie. Wszystko, co opiera się na liście botów z Q1 2026, już dziś błędnie klasyfikuje ruch.
  3. Meta went from absent to the heaviest AI crawler in eight weeks. Zero żądań do maja, potem 553 w czerwcu i 2 615 przez pierwsze trzynaście dni lipca, przy zerowych sprawdzeniach robots.txt. W skali pełnych sześciu miesięcy wciąż zajmuje dopiero dwunaste miejsce, i właśnie dlatego ranking z jednego okna to słaba podstawa decyzji o budżecie crawlowania.
  4. The IP fingerprint inverted.
    ChatGPT-User: wtedy blisko 1:1, dziś 12,4 żądania na IP na 1 588 adresach
    GPTBot: wtedy 2 adresy IP, dziś 129
    Opisany przez nas odcisk zbliżony do 1:1 należy dziś do Claude-User z wynikiem 1,4. Metoda nadal działa; odciski trzeba mierzyć na nowo co kwartał.
  5. llms.txt is measured, not consumed. Kiedyś nie pobierał go nikt, dziś jest pobierany nieustannie, ale w przeważającej mierze przez wyspecjalizowane skanery, audytory gotowości na AI i sondy badawcze, a nie przez czołowe laboratoria. Pobierają go CCBot, ClaudeBot i Googlebot. GPTBot nie.

Why We Re-Tested Our Own Insights

W marcu 2026 opublikowaliśmy dwadzieścia wniosków o zachowaniu botów AI, wyciągniętych z 48 dni logów serwera w jednym serwisie. Oto co zrobiło z nimi dłuższe, późniejsze okno pomiarowe.

Badania botów starzeją się źle, a niemal nikt ich nie weryfikuje. Chcieliśmy wiedzieć jak źle, więc puściliśmy pierwotną listę przez sześć miesięcy logów z trzech serwisów i zapisaliśmy werdykt dla każdego wniosku. Siedemnaście dało się zweryfikować. Jedenaście z nich ruszyło z miejsca w ciągu pięciu miesięcy.

Pierwotny artykuł nadal jest opublikowany dokładnie w tej samej postaci: Ruch botów AI szybko przyspiesza, badanie z 48 dni. Nic nie zostało tam po cichu poprawione. Ten tekst jest jego audytem.

The 20 Takeaways, Re-Tested Six Months Later

Jak zestarzały się pierwotne wnioski · 11 z 17 zmieniło się w pięć miesięcy
6Nieaktualne
6Nadal aktualne
5Przesunięte

Nieaktualne i przesunięte razem dają 11 z 17 wniosków, 65% listy, w mniej więcej pięć miesięcy. Każdy werdykt opisuje, co zrobiła dalej populacja crawlerów, a nie błąd w pierwotnym pomiarze. Werdykty pochodzą z późniejszego, dłuższego okna: 154 864 sklasyfikowanych żądań w trzech serwisach między 1 lutego a 13 lipca 2026, zestawionych z większym serwisem ecommerce.

  1. 01Przesunięte

    Twój sitemap.xml właśnie zyskał na znaczeniu. GPTBot i ClaudeBot w marcu 2026 podniosły korzystanie z sitemapy na wyższy poziom i już z niego nie zeszły. Jeśli twoja sitemapa jest nieaktualna, niekompletna albo brakuje w niej wariantów językowych, crawlery AI ominą treść.

    Sześć miesięcy później stan na 20.07.26Korzystanie z sitemapy znów wzrosło i utrzymało ten poziom. ClaudeBot jest teraz zdecydowanie dominującym odbiorcą, około 6x więcej niż Googlebot, a oba boty pobierały sitemapy już w lutym, więc marzec był eskalacją, a nie początkiem.

  2. 02Nadal aktualne

    robots.txt nie jest respektowany powszechnie. GPTBot i Meta-WebIndexer nigdy go nie sprawdzają. Jeśli twoja strategia treści pod AI opiera się na dyrektywach robots.txt, pamiętaj, że dwa z najaktywniejszych crawlerów całkowicie je ignorują.

    Sześć miesięcy później stan na 20.07.26GPTBot wykonał 2 żądania do robots.txt przy 6 872 żądaniach treści. Meta zero przy 3 169. Potwierdzone w obu przypadkach.

  3. 03Nieaktualne

    Ruch ChatGPT-User to bezpośredni sygnał cytowania marki w rozmowach z AI. Każde żądanie to realna osoba wklejająca twój URL do ChatGPT. To mierzalna poczta pantoflowa, i szybko rośnie.

    Sześć miesięcy później stan na 20.07.26Wzrost o 11% przez pięć miesięcy, z dołkiem pośrodku: 3 827 w lutym wobec 4 236 w czerwcu. Sygnał jest realny, a wzrost wypłaszczył się po oknie, które mierzyliśmy.

  4. 04Nadal aktualne

    Boty AI crawlują zrywami, a nie równym strumieniem. GPTBot osiągnął 114 żądań na minutę w oknie 3 minut. Jeśli twój serwer nie wytrzymuje ruchu zrywami, crawlery AI mogą zostać zdławione albo trafić na błędy w trakcie indeksowania.

    Sześć miesięcy później stan na 20.07.26Potwierdzone i nasilone. Szczyt to dziś 270 żądań na minutę, przy czterech botach powyżej 130.

  5. 05Nadal aktualne

    OpenAI i Anthropic prowadzą po 3 osobne boty. Jeden do treningu i indeksowania, jeden do wyszukiwania, jeden do sesji użytkowników na żywo. Zablokowanie jednego nie blokuje pozostałych. Twój robots.txt potrzebuje osobnych dyrektyw dla każdego.

    Sześć miesięcy później stan na 20.07.26To dolna, a nie górna granica. OpenAI prowadzi dziś co najmniej cztery, w tym crawler reklamowy publikujący własną listę zakresów IP. Po trzy to podłoga, a nie licznik.

  6. 06Nieaktualne

    OAI-SearchBot i Googlebot to jedyne boty pobierające obrazy w dużej skali. Jeśli obrazy w twoich artykułach niosą treść (wykresy, diagramy, wizualizacje danych), to właśnie te boty wykorzystają je w wynikach wyszukiwania.

    Sześć miesięcy później stan na 20.07.26Sześć botów pobiera dziś większy udział obrazów niż Googlebot. Dwa wymienione tutaj zajmują 7. i 10. miejsce. Pobieranie obrazów jest powszechne w całej populacji crawlerów.

  7. 07Przesunięte

    ChatGPT-User pobiera wyłącznie tekst. Zero obrazów, zero CSS, zero JS. To twoja treść HTML trafia do rozmów z AI. Uporządkowany, jasny tekst liczy się dla widoczności w AI bardziej niż warstwa wizualna.

    Sześć miesięcy później stan na 20.07.26Blisko tego, ale już nie zero: 1,9% obrazów wobec 95,3% stron. Części dotyczącej CSS i JavaScriptu nie da się sprawdzić, bo potok logów usuwa te pliki przed zapisem.

  8. 08Przesunięte

    Crawlery AI mają szczyty o różnych godzinach. GPTBot uderza o 04:00 UTC. Claude-SearchBot ma szczyt w nocy. PerplexityBot zrywa się o 23:00, 05:00 i 09:00. Jeśli wdrażasz zmiany poza szczytem czasu amerykańskiego, boty AI mogą zobaczyć je pierwsze.

    Sześć miesięcy później stan na 20.07.26Wzorzec się utrzymuje, a każda konkretna godzina się przesunęła. GPTBot ma teraz szczyt o 17:00 UTC i jest najsilniej skoncentrowanym w czasie crawlerem, jaki zmierzyliśmy: 21,4% całego jego wolumenu mieści się w tej jednej godzinie.

  9. 09Przesunięte

    Meta jest najbardziej agresywnym crawlerem AI pod względem wolumenu. Meta-WebIndexer wysłał więcej żądań niż jakikolwiek inny bot w tym zbiorze, przy zerowych sprawdzeniach robots.txt. Jeśli nie śledzisz crawlerów Meta, pomijasz największego gracza.

    Sześć miesięcy później stan na 20.07.26Ten wniosek wyprzedzał dane w chwili pisania, a teraz dane go doganiają. W skali pełnych sześciu miesięcy Meta zajmuje 12. miejsce. W lipcu jest pojedynczo najcięższym crawlerem AI w serwisie, po całkowitej nieobecności do maja.

  10. 10Nieaktualne

    Adopcja llms.txt jest wciąż teoretyczna. Przez 48 dni żaden bot AI nie zażądał /llms.txt. Może kiedyś stanie się standardem, ale obecnie żaden crawler go nie szuka.

    Sześć miesięcy później stan na 20.07.26Od tego czasu zaczął być pobierany nieustannie, ale w przeważającej mierze przez skanery, audytory i sondy badawcze, a nie przez czołowe laboratoria. Pobierają go CCBot, ClaudeBot i Googlebot. GPTBot nie.

  11. 11Przesunięte

    Applebot renderuje twoje strony w całości. Pobiera CSS, JS i obrazy (47% jego ruchu). Jeśli twoja treść wymaga renderowania JavaScript, żeby była kompletna, Applebot ją zobaczy, ale większość botów AI nie.

    Sześć miesięcy później stan na 20.07.26Kierunkowo trafne, dziś istotnie niżej: obrazy to 27,6% ruchu Applebota wobec ówczesnych 47%. Części dotyczącej CSS i JavaScriptu nie da się tu sprawdzić z tego samego powodu co przy wniosku 9 powyżej.

  12. 12Nadal aktualne

    Treści techniczne i poradnikowe są najczęściej przywoływane w rozmowach z AI. Najczęściej odwiedzane przez ChatGPT-User strony to wyłącznie przewodniki wdrożeniowe i objaśnienia techniczne. Głęboka, konkretna treść zdobywa cytowania w AI.

    Sześć miesięcy później stan na 20.07.26Najbardziej odporny wniosek z pierwotnej listy. Wszystkie dwanaście najczęstszych celów to przewodniki wdrożeniowe, porównania narzędzi albo analizy techniczne. Nic ogólnego, nic promocyjnego. Jeden przewodnik migracyjny przyciągnął 34% całego ruchu ChatGPT-User w sieci serwisów.

  13. 13Nieaktualne

    Bytespider i CCBot tylko sprawdzają robots.txt i nigdy nie crawlują. Konsumują twoje dyrektywy robots.txt, nie robiąc z nimi nic dalej. To może się zmienić, ale obecnie generują narzut zgodności przy zerowym indeksowaniu treści.

    Sześć miesięcy później stan na 20.07.26Odwróciło się od czasu pomiaru. Bytespider jest dziś trzecim najcięższym crawlerem w serwisie, a 94% jego 16 810 żądań to treść, a nie zgodność.

  14. 14Nadal aktualne

    Wolumen crawlowania AI potrafi zmienić się z dnia na dzień. GPTBot przeszedł z 0 do 187 żądań w jeden tydzień. Prognozy budżetu crawlowania muszą uwzględniać nagłe skoki, a nie stopniowy wzrost.

    Sześć miesięcy później stan na 20.07.26Potwierdzone, z czystszym przykładem niż pierwotnie przywołany. Meta przeszła z zera do 2 615 żądań miesięcznie w około osiem tygodni.

  15. 15Nieaktualne

    Analiza IP odsłania tożsamość bota. Stosunek IP do żądań bliski 1:1 u ChatGPT-User dowodzi indywidualnych sesji użytkowników. 2 adresy IP GPTBota dowodzą scentralizowanej infrastruktury. Wzorce IP pomagają odróżnić pobrania wywołane przez realnych użytkowników od automatycznego crawlowania.

    Sześć miesięcy później stan na 20.07.26Metoda przetrwała, a każda liczba w niej się zmieniła. ChatGPT-User ma dziś 12,4 żądania na IP na 1 588 adresach. GPTBot ma 129 adresów IP, nie 2. Opisany tu odcisk zbliżony do 1:1 należy dziś do Claude-User z wynikiem 1,4.

  16. 16Nadal aktualne

    Skoordynowane akcje crawlowania zdarzają się w obrębie rodzin botów. GPTBot i OAI-SearchBot ruszyły jednocześnie 19 marca z tej samej infrastruktury Microsoft. Kiedy jeden bot OpenAI przyspiesza, spodziewaj się reszty.

    Sześć miesięcy później stan na 20.07.26Potwierdzone niezależnie dokładnie w przywołanej dacie, jeden z zaledwie dwóch dni w sześć miesięcy, gdy oba boty przekroczyły te progi razem.

  17. 17Nieaktualne

    Boty, o których nigdy nie słyszałeś, już cię odwiedzają. PromptingBot, LinkupBot, Brightbot, Observer i inne aktywnie crawlują treści. Krajobraz botów AI jest szerszy, niż sugerują znane nazwy.

    Sześć miesięcy później stan na 20.07.26Wszystkie cztery wymienione boty wykonały zero żądań przez nowe sześć miesięcy. Sama teza przetrwała, ale z zupełnie inną obsadą: długi ogon zdominowały dziś skanery llms.txt i audytory gotowości na AI. Każda lista nazw ma termin przydatności liczony w miesiącach.

This data is representative of wislr.com only and should not be read as an overall industry trend. Our intent is to spark conversation, share data, and encourage brands to inspect this for themselves.


What Six Months of Logs Changed

Pierwotne badanie trwało 48 dni w jednym serwisie. Ta powtórka obejmuje 154 864 sklasyfikowane żądania w trzech serwisach między 1 lutego a 13 lipca 2026, zestawione z większym serwisem ecommerce o wolumenie 7,26 miliona żądań, z tożsamością bota ustalaną po user-agencie na podstawie tabeli referencyjnej z 75 wzorcami.

Jak czytać tutejsze źródła

Pierwotne badanie z 48 dni obejmowało jedną witrynę i tak było opisane. Ta powtórka obejmuje trzy prowadzone przez nas serwisy, oznaczone jako Serwis A, Serwis B i Serwis C, plus większy serwis porównawczy. Nie przypisujemy etykiet do domen, więc dane z sześciu miesięcy podajemy bez atrybucji.

Jedenaście z siedemnastu wniosków, które dało się zweryfikować, ruszyło z miejsca w ciągu pięciu miesięcy: sześć zdezaktualizowały nowe zachowania crawlerów, pięć przesunęło się istotnie. To tempo jest właściwym wnioskiem. Wzorzec pod spodem waży więcej niż jakakolwiek pojedyncza korekta: zachowania się utrzymały, a liczby się zmieniły. Zrywy, skoordynowane akcje dostawców, przewaga treści technicznych, wszystko to nadal jest. Każda konkretna nazwa bota, każdy współczynnik i każda godzina szczytu, które opublikowaliśmy, uległy zmianie.

Rankingi są niestabilne. Zachowania są stabilne. Wszystko, co zbudowałeś na liście botów z Q1 2026, już dziś błędnie klasyfikuje ruch.

Meta went from absent to first in eight weeks

Największa pojedyncza zmiana w zbiorze. meta-externalagent nie zanotował absolutnie nic do maja, jedno samotne żądanie w tym miesiącu, potem 553 w czerwcu i 2 615 przez pierwsze trzynaście dni lipca. Jest dziś najcięższym crawlerem AI w serwisie, a lipiec to miesiąc niepełny, więc ta liczba go zaniża.

Żądania miesięcznie: funkcja schodkowa Meta wobec płaskiego ChatGPT-User
Od lutego do lipca 2026 · lipiec niepełny, do 13.
meta-externalagentChatGPT-User

W skali pełnych sześciu miesięcy Meta zajmuje dwunaste miejsce. W lipcu pierwsze. Oba stwierdzenia są prawdziwe, i właśnie dlatego ranking z jednego okna to słaba podstawa decyzji o budżecie crawlowania. Wykonał też zero żądań do robots.txt na 3 169 odsłon.

The bot rankings churn, the behaviours do not

Czternaście botów o wolumenie wystarczającym do śledzenia miesiąc po miesiącu. Zobacz, jak mało kształt tej populacji przypomina sam siebie od lutego do lipca.

Każdy śledzony bot, miesiąc po miesiącu
Uszeregowane po wolumenie z sześciu miesięcy · każdy panel skalowany do własnego maksimum · Meta na czerwono

The IP fingerprint inverted

Pierwotna analiza używała liczby żądań na IP, by odróżnić pobrania wywołane przez użytkownika od scentralizowanego crawlowania. Metoda nadal działa. Każda liczba w niej się zmieniła.

Żądania na odrębny adres IP
PerplexityBot90.2
GPTBot53.3
ClaudeBot41.4
ChatGPT-User12.4
Claude-User1.4

ChatGPT-User był w pierwotnym oknie blisko 1:1, a dziś ma 12,4 żądania na IP na 1 588 adresach: OpenAI skonsolidowało ten ruch za mniejszą liczbą bardziej obciążonych adresów wyjściowych. GPTBot ma 129 adresów IP, a nie 2, o których pisaliśmy. Opisany przez nas odcisk zbliżony do 1:1 należy dziś do Claude-User.

Metoda nadal działa. Odciski trzeba mierzyć na nowo co kwartał.

Image fetching is now common

W chwili pomiaru OAI-SearchBot i Googlebot były jedynymi botami pobierającymi obrazy w dużej skali. Od tego czasu pobieranie obrazów rozlało się na całą populację crawlerów: sześć botów ma dziś wyższy udział niż Googlebot, a dwa pierwotnie wymienione są siódmy i dziesiąty.

Obrazy jako udział w całkowitej liczbie żądań danego bota
Storebot-Google53.5%
TikTokSpider41.4%
Bytespider37.7%
DuckDuckBot33.8%
Applebot27.6%
GoogleOther26.7%
Googlebot18.4%
GPTBot16.5%
bingbot16.0%
OAI-SearchBot12.6%

Wyróżnione wiersze to dwa boty, które pierwotnie wskazaliśmy jako jedyne pobierające obrazy w dużej skali.

llms.txt is measured, not consumed

W chwili pomiaru żaden bot nigdy nie zażądał /llms.txt. To zmieniło się całkowicie, choć nie w taki sposób, jakiego chcieliby zwolennicy standardu. Plik jest pobierany nieustannie, niemal wyłącznie przez narzędzia, które istnieją po to, by sprawdzić, czy go publikujesz.

Kto pobiera llms.txtŻądania
Ogólne skrypty (curl, node, axios)66
Wyspecjalizowane skanery llms.txt50
Sondy badawcze, w tym badanie prompt injection42
Crawlery audytujące gotowość na AI34
Startupy indeksujące33

Rozpoznane crawlery dużych dostawców zauważone przy pobieraniu: CCBot, ClaudeBot, Googlebot i GoogleOther. Wyraźnie nieobecny: GPTBot.

Publikacja llms.txt sprawia, że mierzy cię branża narzędzi do widoczności w AI. Nie sprawia jeszcze, że czytają cię czołowe laboratoria.

Bytespider does not just check robots.txt

Ten wniosek nie dryfował, on się odwrócił. Bytespider jest dziś trzecim najcięższym crawlerem w serwisie, a 94% jego żądań to treść.

BotRazemrobots.txtStronyObrazy
Bytespider16,8101,0864,8786,339
CCBot730706736

What Held Up

Sześć pierwotnych wniosków przetrwało dłuższe okno w nienaruszonym stanie, i są to te, które opisują zachowanie, a nie wskazują lidera.

Treści techniczne zdobywają cytowania. Najbardziej odporny wniosek z pierwotnej listy. Wszystkie dwanaście najczęstszych celów ChatGPT-User to przewodniki wdrożeniowe, porównania narzędzi albo analizy techniczne. Nic ogólnego, nic promocyjnego. Jeden przewodnik migracyjny przyciągnął 6 716 żądań, czyli 34% całego ruchu ChatGPT-User w sieci serwisów.

GPTBot nadal ignoruje robots.txt. Dwa żądania do robots.txt przy 6 872 żądaniach treści. Meta zero przy 3 169.

Zrywy się nasiliły, a nie osłabły. Szczytowe tempo jest dziś znacznie powyżej pierwotnie raportowanych 114 żądań na minutę.

Szczytowa liczba żądań na minutę
Storebot-Google270
ChatGPT-User221
Googlebot172
DuckAssistBot152
Applebot132

Dostawcy nadal prowadzą floty botów, a my je niedoszacowaliśmy. OpenAI operuje co najmniej czterema odrębnymi crawlerami, w tym reklamowym, który publikuje własną listę zakresów IP. Anthropic prowadzi ClaudeBot, Claude-User i Claude-SearchBot. Po trzy to była podłoga, a nie licznik.

Skoordynowane akcje są realne. Potwierdzone dokładnie w dacie przywołanej w pierwotnym wpisie: 19 marca GPTBot ma 206 żądań, a OAI-SearchBot 114, jeden z zaledwie dwóch dni w sześć miesięcy, gdy oba przekroczyły te progi razem.

Boty nadal mają szczyty o różnych godzinach, i każda godzina się przesunęła. GPTBot nie ma już szczytu o 04:00 UTC. Ma go teraz o 17:00 i jest najsilniej skoncentrowanym w czasie crawlerem, jaki zmierzyliśmy: 21,4% całego jego sześciomiesięcznego wolumenu przypada na tę jedną godzinę doby.

BotGodzina szczytu (UTC)Udział jego ruchu w tej godzinie
GPTBot17:0021.4%
ChatGPT-User16:0010.1%
Bytespider19:009.0%
Applebot00:007.8%
bingbot03:006.5%

What We Could Not Test

Dwa pozorne odkrycia okazały się artefaktami sposobu zbierania logów. Oba warto wskazać, bo każde mogło dać pewny siebie nagłówek, którego dane nie potwierdzają.

robots.txt jest niewidoczny w serwisie porównawczym. Zwrócił zero żądań do robots.txt od jakiegokolwiek bota, co wygląda na dramatyczny wniosek o zgodności, a nim nie jest. Ta witryna serwuje robots.txt na brzegu CDN, więc żądanie nigdy nie dociera do logowanej warstwy. Wszystkie wnioski o robots.txt pochodzą tutaj wyłącznie z serwisu głównego.

Wniosków o CSS i JavaScript nie da się na tych danych sprawdzić w żadną stronę. Sanitizer logów usuwa .css, .js, czcionki i source mapy przed zapisem. Wnioski 9 i 13 można testować tylko w części dotyczącej obrazów.

Dwa drobniejsze zastrzeżenia. Zbiór obejmuje trzy powiązane serwisy, a nie jeden, a najczęściej cytowana treść leży w pojedynczej witrynie w tej sieci, co koncentruje wnioski o cytowaniach. Lipiec jest miesiącem niepełnym, liczonym do 13., więc lipcowe liczby zaniżają: Meta dociera na pierwsze miejsce mimo tego.

Sprawdź, co odrzuca twój potok logowania, zanim wyciągniesz wnioski. Dwa nasze własne odkrycia były artefaktami sanitizera.