Skip to main content
Carl, host of the WISLR crawl quiz

Тиждень від 3 серпня 2026 року

Кого ці боти намагаються надурити?

Більшість написаного про ШІ-краулерів походить з анонсів вендорів, а не з логів. Ці запитання походять з обох джерел: зі справжніх логів периферійних серверів середнього за розміром інтернет-магазину та з документації, яку ШІ-компанії публікують самі. Дайте відповідь на кожне запитання, і докази з'являться одразу.

Запитання
10
Хвилини
6
  1. 1

    Який бот за минулий тиждень найчастіше запитував /sitemap.xml?

    Bingbot від Microsoft

    Bingbot звернувся до нього десятки разів. Справжні краулери GPTBot, ClaudeBot, PerplexityBot і Gemini не звернулися до нього жодного разу, попри тисячі запитів до того самого сайту. ШІ-краулери переважно знаходять контент, переходячи за посиланнями, а не читаючи карти сайту. Подання sitemap є ритуалом пошукових систем, і для видимості в ШІ він, наскільки нам відомо, дає дуже мало.

  2. 2

    Що таке Google-Extended?

    Токен у robots.txt, який визначає, чи використовується просканований контент для навчання та обґрунтування відповідей Gemini

    Він ніколи не надсилає жодного запиту. Google зазначає, що Google-Extended не має власного окремого user-agent, тож сканування й далі відбувається звичайними краулерами Google, а токен керує лише тим, що станеться з цим контентом потім: навчанням майбутніх моделей Gemini та обґрунтуванням відповідей у Gemini Apps і Vertex AI. Google також прямо каже, що це не впливає на присутність сайту в Google Search і не є сигналом ранжування, тож блокування нічого не коштує вам у Search і не зменшить ваш трафік сканування жодним запитом.

  3. 3

    Який єдиний надійний спосіб підтвердити, що запит справді надійшов від GPTBot?

    Зворотний DNS у поєднанні з опублікованими вендором діапазонами IP

    Рядки user-agent є вільним текстом. Будь-хто може надіслати будь-який із них, і чимало сканерів саме так і роблять.

  4. 4

    Яка активність OpenAI генерує найбільше запитів у типового видавця?

    ChatGPT-User, який завантажує сторінку, бо людина про неї запитала

    Завантаження, ініційовані користувачами, перевищили навчальні сканування приблизно у співвідношенні приблизно шість до одного. Більшість трафіку ШІ-ботів припадає не на навчання, а на запитання реальної людини, на яке відповідають у реальному часі.

  5. 5

    У ваших логах видно трафік із міткою OpenAI з IP-адреси Google Cloud. Яке пояснення найімовірніше?

    Підроблений user-agent

    Ми зафіксували саме такий випадок: один сканер в одній мережі Google Cloud надіслав значно понад тисячу запитів за 72 години, чергуючи user-agent OpenAI, Perplexity і Gemini та звертаючись до однієї URL-адреси на кожен шлях. Це перебір адрес, а не сканування. Справжні краулери OpenAI виходять із Azure.

  6. 6

    Що найкраще описує те, як великі ШІ-компанії сканують веб?

    Кожна компанія запускає кілька окремих ботів із різними завданнями

    Власна документація OpenAI перелічує чотирьох: GPTBot для навчальних даних, ChatGPT-User для живого завантаження, коли людина ставить запитання, OAI-SearchBot для результатів пошуку в ChatGPT і OAI-AdsBot для перевірки сторінок, поданих як реклама. Anthropic та інші дотримуються тієї самої схеми. OpenAI зазначає, що кожне налаштування є незалежним, тож видавець може дозволити OAI-SearchBot, щоб з'являтися в пошуку, і водночас заборонити GPTBot. Це означає, що питання «чи дозволяти ШІ-ботів?» має не одну відповідь, а чотири.

  7. 7

    Ви додаєте до robots.txt рядок User-agent: GPTBot із директивою Disallow: /. Що все одно доходить до вашого сайту?

    ChatGPT-User і OAI-SearchBot

    Блокування одного токена блокує одного бота. OpenAI зазначає, що кожне налаштування є незалежним, тож пошуковий краулер, рекламний краулер і живе завантаження на запит користувача працюють далі. ChatGPT-User є найскладнішим випадком: оскільки ці запити ініціює людина, а не розклад сканування, OpenAI зазначає, що правила robots.txt можуть до нього взагалі не застосовуватися. Більшість конфігурацій «ми заблокували ШІ» зупиняють навчання й залишають цілком недоторканими тих ботів, які насправді формують відповіді, видимі користувачам.

  8. 8

    Великий краулер запитав news-sitemap.xml, sitemap.txt, sitemap.html і sitemap-index.xml, усі з кодом 404, на сайті, robots.txt якого коректно вказує його карту сайту. Про що це свідчить?

    Деякі краулери підбирають назви файлів карти сайту методом перебору замість того, щоб прочитати директиву Sitemap

    Саме так робить краулер Meta. Коректний рядок Sitemap у robots.txt жодним чином не гарантує, що краулер ним скористається.

  9. 9

    Відвідувач ставить запитання ChatGPT, переходить на ваш сайт і щось купує. Чому ваша аналітика може так і не зарахувати цей візит ChatGPT?

    Багато ШІ-клієнтів не передають реферера, тож візит записується як прямий

    Дані про реферера від ШІ-асистентів неповні за самою своєю природою. Десктопні та мобільні застосунки часто взагалі не передають заголовок referer, вбудовані браузери поводяться непослідовно, а деякі клієнти надсилають лише голий домен. Такий трафік потрапляє в прямі переходи разом із закладками та введеними вручну адресами. Цифри з боку рефералів є нижньою межею, а не вимірюванням.

  10. 10

    Як за типовий тиждень обсяг сканування ШІ-краулерами співвідноситься з обсягом сканування традиційними пошуковими краулерами?

    Пошук усе ще приблизно від 20 до 25 разів більший

    Google і Bing разом зробили значно понад сто тисяч запитів за 72 години; усі перевірені ШІ-краулери разом зробили кілька тисяч. Сканування з боку ШІ зростає і воно реальне, але воно не витіснило пошукове сканування, а заголовки, які натякають на протилежне, зазвичай рахують підроблені user-agent.