Skip to main content
Carl, host of the WISLR crawl quiz

Semana de 3 de agosto de 2026

Quem Esses Bots Estão Enganando?

Quase tudo o que se escreve sobre crawlers de IA vem de anúncios de fornecedores, não de logs. Estas perguntas vêm dos dois lados: logs de borda reais de um ecommerce de porte médio e a documentação de crawlers que as próprias empresas de IA publicam. Responda cada uma e a evidência aparece na hora.

Perguntas
10
Minutos
6
  1. 1

    Na última semana, qual bot solicitou /sitemap.xml com mais frequência?

    O Bingbot, da Microsoft

    O Bingbot buscou o arquivo dezenas de vezes. Os crawlers reais GPTBot, ClaudeBot, PerplexityBot e Gemini o buscaram zero vezes, apesar de terem feito milhares de requisições ao mesmo site. Os crawlers de IA descobrem conteúdo de forma esmagadora seguindo links, não lendo sitemaps. Enviar um sitemap é um ritual de mecanismo de busca; ele faz muito pouco pela visibilidade em IA, até onde sabemos.

  2. 2

    O que é o Google-Extended?

    Um token de robots.txt que controla se o conteúdo rastreado treina e fundamenta o Gemini

    Ele nunca faz uma requisição. O Google afirma que o Google-Extended não tem um user agent próprio, então o rastreamento continua acontecendo pelos crawlers normais do Google e o token governa apenas o que acontece com aquele conteúdo depois: treinar modelos Gemini futuros e fundamentar respostas no Gemini Apps e no Vertex AI. O Google também é explícito ao dizer que isso não afeta a inclusão de um site na Busca do Google e não é um sinal de ranqueamento, então bloqueá-lo não custa nada na Busca e não vai reduzir o seu tráfego de rastreamento em uma única requisição.

  3. 3

    Qual é a única forma confiável de confirmar que uma requisição veio mesmo do GPTBot?

    DNS reverso somado às faixas de IP publicadas pelo fornecedor

    Strings de user-agent são texto livre. Qualquer um pode enviar qualquer uma delas, e muitos scanners fazem exatamente isso.

  4. 4

    Para um publisher típico, qual atividade da OpenAI gera mais requisições?

    O ChatGPT-User buscando uma página porque uma pessoa perguntou sobre ela

    As buscas iniciadas por usuários superaram os rastreamentos de treinamento em cerca de seis para um. A maior parte do tráfego de bots de IA não é treinamento, é a pergunta de uma pessoa real sendo respondida em tempo real.

  5. 5

    Seus logs mostram tráfego rotulado como OpenAI vindo de um IP do Google Cloud. Qual é a explicação mais provável?

    Um user-agent falsificado

    Flagramos exatamente isso: um scanner em uma única rede do Google Cloud enviou bem mais de mil requisições em três dias, alternando entre user-agents da OpenAI, da Perplexity e do Gemini, e acessando uma URL por caminho. Isso é enumeração, não rastreamento. Os crawlers reais da OpenAI saem pelo Azure.

  6. 6

    O que melhor descreve a forma como as grandes empresas de IA rastreiam a web?

    Cada empresa opera vários bots distintos, com funções diferentes

    A própria documentação da OpenAI lista quatro: GPTBot para dados de treinamento, ChatGPT-User para uma busca ao vivo quando uma pessoa pergunta, OAI-SearchBot para os resultados de busca do ChatGPT e OAI-AdsBot para verificar páginas enviadas como anúncios. A Anthropic e as demais seguem o mesmo padrão. A OpenAI afirma que cada configuração é independente, então um publisher pode liberar o OAI-SearchBot para aparecer na busca e ao mesmo tempo bloquear o GPTBot. Ou seja, "devo permitir bots de IA?" não é uma decisão, são quatro.

  7. 7

    Você adiciona User-agent: GPTBot com Disallow: / ao robots.txt. O que ainda chega ao seu site?

    ChatGPT-User e OAI-SearchBot

    Bloquear um token bloqueia um bot. A OpenAI afirma que cada configuração é independente, então o crawler de busca, o crawler de anúncios e a busca ao vivo do usuário seguem funcionando. O ChatGPT-User é o caso mais delicado: como essas requisições partem de uma pessoa e não de um agendamento de rastreamento, a OpenAI observa que as regras do robots.txt podem simplesmente não se aplicar a ele. A maioria das configurações do tipo "bloqueamos a IA" interrompe o treinamento e deixa completamente intocados justamente os bots que geram as respostas visíveis para o usuário.

  8. 8

    Um crawler importante solicitou news-sitemap.xml, sitemap.txt, sitemap.html e sitemap-index.xml, todos com 404, em um site cujo robots.txt declara corretamente o seu sitemap. O que isso mostra?

    Alguns crawlers adivinham nomes de arquivo de sitemap por força bruta em vez de ler a diretiva Sitemap

    O crawler da Meta faz exatamente isso. Uma linha Sitemap correta no robots.txt não garante que um crawler vá usá-la.

  9. 9

    Uma visitante faz uma pergunta ao ChatGPT, clica para o seu site e compra algo. Por que a sua ferramenta de analytics pode nunca creditar o ChatGPT?

    Muitos clientes de IA não enviam referrer, então a visita é registrada como direta

    Os dados de referrer dos assistentes de IA são falhos por design. Os aplicativos de desktop e de celular com frequência não enviam nenhum cabeçalho referer, os navegadores embutidos se comportam de forma inconsistente e alguns clientes mandam apenas o domínio puro. Esse tráfego cai em direto, junto com favoritos e URLs digitadas. Os números do lado da referência são um piso, não uma medição.

  10. 10

    Em uma semana típica, como o volume dos crawlers de IA se compara ao dos crawlers de busca tradicionais?

    A busca ainda é cerca de 20 a 25 vezes maior

    Google e Bing juntos fizeram bem mais de cem mil requisições em três dias; todos os crawlers de IA verificados somados fizeram alguns milhares. O rastreamento de IA está crescendo e é real, mas não substituiu o rastreamento de busca, e as manchetes que sugerem o contrário costumam estar contando user-agents falsificados.