Skip to main content

Publicamos 20 insights sobre bots de IA. Seis meses depois, 65% tinham mudado.

Em março de 2026 publicamos 20 conclusões sobre o comportamento de bots de IA a partir de 48 dias de logs de servidor. Retestamos tudo ao longo de seis meses de logs: 11 dos 17 insights que conseguimos retestar tinham mudado, 65% da lista, em cerca de cinco meses. Seis foram superados por novos comportamentos de crawler, cinco mudaram de magnitude e seis continuam válidos. A Meta passou de ausente ao crawler de IA mais pesado em oito semanas, a assinatura de IPs do ChatGPT-User se inverteu, o llms.txt agora é buscado constantemente mas quase só por scanners, não pelos laboratórios de fronteira, e o Bytespider se revelou o terceiro crawler mais pesado, não um turista de robots.txt.

Seis meses de logs de servidor de bots de IA retestando vinte insights anteriores sobre GPTBot, ChatGPT-User, ClaudeBot, meta-externalagent e Bytespider
Seis meses de logs de servidor de bots de IA retestando vinte insights anteriores sobre GPTBot, ChatGPT-User, ClaudeBot, meta-externalagent e Bytespider
O que mudou
  1. 55% of what we published had changed within five months. Onze dos dezessete insights retestados se moveram: seis superados por novos comportamentos de crawler e cinco com mudança material de magnitude. Seis continuam válidos. Reteste feito em três propriedades entre 1 de fevereiro e 13 de julho de 2026, com o veredito de cada insight registrado abaixo.
  2. Rankings churn. Behaviours do not. O rastreamento em rajadas, os eventos coordenados por fornecedor e a preferência por conteúdo técnico sobreviveram à janela mais longa. Todo nome de bot, proporção e horário de pico que publicamos mudou. Qualquer coisa construída sobre uma lista de bots do primeiro trimestre de 2026 já está identificando tráfego de forma errada.
  3. Meta went from absent to the heaviest AI crawler in eight weeks. Zero requisições até maio, depois 553 em junho e 2.615 nos primeiros treze dias de julho, sem nenhuma verificação de robots.txt. No conjunto dos seis meses ele ainda ocupa apenas o décimo segundo lugar, e é exatamente por isso que um ranking de janela única é uma base fraca para decidir orçamento de rastreamento.
  4. The IP fingerprint inverted.
    ChatGPT-User: perto de 1:1 antes, 12.4 requisições por IP agora em 1,588 endereços
    GPTBot: 2 IPs antes, 129 agora
    A assinatura de quase 1:1 que descrevemos hoje pertence ao Claude-User, em 1.4. O método continua funcionando; as assinaturas precisam ser remedidas a cada trimestre.
  5. llms.txt is measured, not consumed. Antes ninguém buscava, agora é buscado continuamente, mas de forma esmagadora por scanners dedicados, auditores de prontidão para IA e sondas de pesquisa, não pelos laboratórios de fronteira. CCBot, ClaudeBot e Googlebot buscam. O GPTBot não.

Why We Re-Tested Our Own Insights

Em março de 2026 publicamos vinte conclusões sobre o comportamento de bots de IA, extraídas de 48 dias de logs de servidor de uma única propriedade. Isto é o que uma janela mais longa e mais recente fez com elas.

Pesquisa sobre bots envelhece mal, e quase nunca é reconferida. Queríamos saber o quanto, então rodamos a lista original contra seis meses de logs em três propriedades e registramos um veredito para cada insight. Dezessete puderam ser retestados. Onze deles se moveram em cinco meses.

O artigo original continua publicado exatamente como estava: o tráfego de bots de IA está acelerando rápido, o estudo de 48 dias. Nada ali foi editado em silêncio. Este texto é a auditoria dele.

The 20 Takeaways, Re-Tested Six Months Later

Como os insights originais envelheceram · 11 de 17 mudaram em cinco meses
6Superados
6Ainda valem
5Mudaram

Superados e mudados somam 11 dos 17 insights, 65% da lista, em cerca de cinco meses. Cada veredito descreve o que a população de crawlers fez depois, não uma falha na medição original. Os vereditos vêm de uma janela posterior e mais longa: 154,864 requisições classificadas em três propriedades entre 1 de fevereiro e 13 de julho de 2026, cruzadas com uma propriedade de ecommerce maior.

  1. 01Mudou

    Seu sitemap.xml acabou de ficar mais importante. GPTBot e ClaudeBot elevaram o consumo de sitemap a um patamar mais alto em março de 2026 e nunca mais recuaram. Se o seu sitemap estiver desatualizado, incompleto ou sem variantes de idioma, os crawlers de IA vão perder conteúdo.

    Seis meses depois em 20/07/26O consumo de sitemap subiu de novo e ficou nesse patamar. O ClaudeBot hoje é o consumidor dominante com folga, cerca de 6x o Googlebot, e os dois bots já buscavam sitemaps em fevereiro, então março marcou uma escalada, não um início.

  2. 02Ainda vale

    robots.txt não é respeitado universalmente. GPTBot e Meta-WebIndexer nunca verificam o arquivo. Se sua estratégia de conteúdo para IA depende das diretivas do robots.txt, saiba que dois dos crawlers mais ativos as ignoram por completo.

    Seis meses depois em 20/07/26O GPTBot fez 2 requisições a robots.txt contra 6,872 requisições de conteúdo. A Meta fez zero em 3,169. Confirmado nos dois casos.

  3. 03Superado

    O tráfego do ChatGPT-User é um sinal direto de citação da marca em conversas com IA. Cada requisição representa uma pessoa real colando sua URL no ChatGPT. É boca a boca mensurável, e está crescendo rápido.

    Seis meses depois em 20/07/26Alta de 11% em cinco meses, com uma queda no meio: 3,827 em fevereiro contra 4,236 em junho. O sinal é real, e o crescimento se achatou depois da janela que medimos.

  4. 04Ainda vale

    Bots de IA rastreiam em rajadas, não em fluxo constante. O GPTBot chegou a 114 req/min numa janela de 3 minutos. Se o seu servidor não aguenta tráfego em rajada, os crawlers de IA podem ser limitados ou receber erros durante suas rodadas de indexação.

    Seis meses depois em 20/07/26Confirmado e intensificado. O pico agora é de 270 requisições por minuto, com quatro bots acima de 130.

  5. 05Ainda vale

    OpenAI e Anthropic operam 3 bots distintos cada uma. Um para treinamento e indexação, um para busca, um para sessões ao vivo de usuários. Bloquear um não bloqueia os outros. Seu robots.txt precisa de diretivas separadas para cada um.

    Seis meses depois em 20/07/26É um piso, não um teto. A OpenAI hoje roda pelo menos quatro, incluindo um crawler de anúncios que publica a própria lista de faixas de IP. Três de cada um é o piso, não a contagem.

  6. 06Superado

    OAI-SearchBot e Googlebot são os únicos bots que buscam imagens em volume. Se as imagens dos seus artigos carregam conteúdo relevante (gráficos, diagramas, visualizações de dados), são esses os bots que vão usá-las nos resultados de busca.

    Seis meses depois em 20/07/26Seis bots hoje buscam uma fatia de imagens maior que a do Googlebot. Os dois citados aqui aparecem em 7º e 10º. Buscar imagens virou comportamento comum na população de crawlers.

  7. 07Mudou

    O ChatGPT-User extrai só texto. Zero imagens, zero CSS, zero JS. Seu conteúdo em HTML é o que entra nas conversas com IA. Texto estruturado e claro pesa mais que design visual para visibilidade em IA.

    Seis meses depois em 20/07/26Perto disso, mas já não é zero: 1.9% de imagens contra 95.3% de páginas. A parte de CSS e JavaScript não dá para verificar, porque o pipeline de logs remove esses arquivos antes do armazenamento.

  8. 08Mudou

    Crawlers de IA têm picos em horas diferentes. O GPTBot ataca às 04:00 UTC. O Claude-SearchBot tem pico de madrugada. O PerplexityBot dispara às 23:00, 05:00 e 09:00. Se você publica mudanças no site fora do horário de pico dos EUA, os bots de IA podem ser os primeiros a vê-las.

    Seis meses depois em 20/07/26O padrão se mantém e todas as horas específicas mudaram. O GPTBot hoje tem pico às 17:00 UTC, e é o crawler mais concentrado no tempo que medimos, com 21.4% de todo o seu volume dentro dessa única hora.

  9. 09Mudou

    A Meta é o crawler de IA mais agressivo em volume. O Meta-WebIndexer enviou mais requisições que qualquer outro bot deste conjunto de dados, com zero verificações de robots.txt. Se você não monitora os crawlers da Meta, está deixando de fora o maior jogador.

    Seis meses depois em 20/07/26Este foi escrito à frente dos dados e agora os dados estão alcançando. No conjunto dos seis meses a Meta fica em 12º. Em julho é o crawler de IA mais pesado da propriedade, depois de estar completamente ausente até maio.

  10. 10Superado

    A adoção do llms.txt ainda é teórica. Zero bots de IA requisitaram /llms.txt em 48 dias. Pode virar padrão algum dia, mas nenhum crawler procura pelo arquivo hoje.

    Seis meses depois em 20/07/26De lá para cá passou a ser buscado continuamente, mas de forma esmagadora por scanners, auditores e sondas de pesquisa, não pelos laboratórios de fronteira. CCBot, ClaudeBot e Googlebot buscam. O GPTBot não.

  11. 11Mudou

    O Applebot renderiza suas páginas por completo. Ele busca CSS, JS e imagens (47% do seu tráfego). Se o seu conteúdo precisa de renderização JavaScript para ficar completo, o Applebot vai ver, mas a maioria dos bots de IA não.

    Seis meses depois em 20/07/26Direção certa, magnitude bem menor hoje: imagens são 27.6% do tráfego do Applebot, contra 47% antes. A parte de CSS e JavaScript não é testável aqui pelo mesmo motivo de pipeline do insight 9 acima.

  12. 12Ainda vale

    Conteúdo técnico e de tutorial é o mais referenciado em conversas com IA. As páginas de topo do ChatGPT-User eram todas guias de implementação e explicações técnicas. Conteúdo profundo e específico conquista citações de IA.

    Seis meses depois em 20/07/26A descoberta mais robusta da lista original. Os doze principais destinos são guias de implementação, comparações de ferramentas ou análises técnicas. Nada genérico, nada promocional. Um único guia de migração atraiu 34% de todo o tráfego de ChatGPT-User da rede.

  13. 13Superado

    Bytespider e CCBot só checam robots.txt e nunca rastreiam. Eles consomem as diretivas do seu robots.txt sem ir adiante. Isso pode mudar, mas hoje geram custo de conformidade com zero indexação de conteúdo.

    Seis meses depois em 20/07/26Inverteu desde a medição. O Bytespider hoje é o terceiro crawler mais pesado da propriedade, e 94% das suas 16,810 requisições são de conteúdo, não de conformidade.

  14. 14Ainda vale

    O volume de rastreamento de IA pode mudar da noite para o dia. O GPTBot foi de 0 a 187 requisições em uma única semana. Suas projeções de orçamento de rastreamento precisam contar com saltos súbitos, não com crescimento gradual.

    Seis meses depois em 20/07/26Confirmado, com um exemplo mais limpo que o citado originalmente. A Meta foi de zero a 2,615 requisições por mês em cerca de oito semanas.

  15. 15Superado

    A análise de IPs revela a identidade do bot. A proporção de quase 1:1 entre IPs e requisições do ChatGPT-User comprova sessões individuais de usuários. Os 2 IPs do GPTBot comprovam infraestrutura centralizada. Padrões de IP ajudam a separar buscas disparadas por pessoas reais de rastreamento automatizado.

    Seis meses depois em 20/07/26O método sobrevive e todos os números dentro dele mudaram. O ChatGPT-User agora roda 12.4 requisições por IP em 1,588 endereços. O GPTBot roda 129 IPs, não 2. A assinatura de quase 1:1 descrita aqui hoje pertence ao Claude-User, em 1.4.

  16. 16Ainda vale

    Eventos coordenados de rastreamento acontecem entre famílias de bots. GPTBot e OAI-SearchBot dispararam simultaneamente em 19 de março, a partir da mesma infraestrutura da Microsoft. Quando um bot da OpenAI acelera, espere que os outros sigam.

    Seis meses depois em 20/07/26Confirmado de forma independente na data exata citada, um de apenas dois dias em seis meses em que os dois bots passaram desses patamares juntos.

  17. 17Superado

    Os bots de que você nunca ouviu falar já estão visitando. PromptingBot, LinkupBot, Brightbot, Observer e outros rastreiam conteúdo ativamente. O cenário de bots de IA é maior do que os nomes conhecidos sugerem.

    Seis meses depois em 20/07/26Os quatro bots citados fizeram zero requisições ao longo dos novos seis meses. O ponto de fundo sobrevive com um elenco totalmente diferente: a cauda longa hoje é dominada por scanners de llms.txt e auditores de prontidão para IA. Qualquer lista de nomes tem validade de meses.

This data is representative of wislr.com only and should not be read as an overall industry trend. Our intent is to spark conversation, share data, and encourage brands to inspect this for themselves.


What Six Months of Logs Changed

O estudo original durou 48 dias em uma única propriedade. Este reteste cobre 154,864 requisições classificadas em três propriedades entre 1 de fevereiro e 13 de julho de 2026, cruzadas com uma propriedade de ecommerce maior com 7.26 milhões de requisições, com identidade de bot resolvida por user-agent contra uma tabela de referência de 75 padrões.

Como ler as fontes aqui

O estudo original de 48 dias cobria um site e dizia isso. Este reteste abrange três propriedades que operamos, identificadas como Site A, Site B e Site C, mais uma propriedade maior de comparação. Não mapeamos os rótulos para domínios, então os números de seis meses são reportados sem atribuição.

Onze dos dezessete insights que conseguimos retestar se moveram em cinco meses, seis superados por novos comportamentos de crawler e cinco com mudança material de magnitude. Essa taxa é a descoberta. O padrão por baixo dela importa mais que qualquer correção isolada: os comportamentos se mantiveram e os números mudaram. Rajadas, eventos coordenados por fornecedor, preferência por conteúdo técnico, tudo continua lá. Todo nome de bot, proporção e horário de pico que publicamos mudou.

Rankings são instáveis. Comportamentos são estáveis. Qualquer coisa que você construiu sobre uma lista de bots do primeiro trimestre de 2026 já está identificando tráfego de forma errada.

Meta went from absent to first in eight weeks

A maior mudança do conjunto de dados. O meta-externalagent não registrou absolutamente nada até maio, uma requisição solitária naquele mês, depois 553 em junho e 2.615 nos primeiros treze dias de julho. Hoje é o crawler de IA mais pesado da propriedade, e julho é um mês parcial, então esse número o subestima.

Requisições mensais: a função degrau da Meta contra um ChatGPT-User estável
Fev a jul de 2026 · julho é parcial, até o dia 13
meta-externalagentChatGPT-User

No conjunto dos seis meses a Meta fica em décimo segundo. Em julho fica em primeiro. As duas afirmações são verdadeiras, e é exatamente por isso que um ranking de janela única é uma base fraca para decidir orçamento de rastreamento. Ela também fez zero requisições a robots.txt em 3,169 acessos.

The bot rankings churn, the behaviours do not

Quatorze bots com volume suficiente para acompanhar mês a mês. Repare em como o formato da população mal se parece consigo mesmo de fevereiro a julho.

Todos os bots monitorados, mês a mês
Ordenados por volume de seis meses · cada painel escalado ao próprio máximo · Meta em vermelho

The IP fingerprint inverted

A leitura original usava requisições por IP para separar buscas disparadas por usuários de rastreamento centralizado. O método continua funcionando. Todos os números dentro dele mudaram.

Requisições por IP distinto
PerplexityBot90.2
GPTBot53.3
ClaudeBot41.4
ChatGPT-User12.4
Claude-User1.4

O ChatGPT-User estava perto de 1:1 na janela original e agora roda 12.4 requisições por IP em 1,588 endereços: a OpenAI consolidou esse tráfego atrás de menos IPs de saída, mais movimentados. O GPTBot roda 129 IPs, não os 2 que reportamos. A assinatura de quase 1:1 que descrevemos hoje pertence ao Claude-User.

O método continua funcionando. As assinaturas precisam ser remedidas a cada trimestre.

Image fetching is now common

Quando medimos, OAI-SearchBot e Googlebot eram os únicos bots puxando imagens em volume. Desde então a busca por imagens se espalhou pela população de crawlers: seis bots hoje buscam uma fatia maior que a do Googlebot, e os dois citados originalmente aparecem em sétimo e décimo.

Imagens como fatia do total de requisições daquele bot
Storebot-Google53.5%
TikTokSpider41.4%
Bytespider37.7%
DuckDuckBot33.8%
Applebot27.6%
GoogleOther26.7%
Googlebot18.4%
GPTBot16.5%
bingbot16.0%
OAI-SearchBot12.6%

As linhas destacadas são os dois bots que citamos originalmente como os únicos que buscavam imagens em volume.

llms.txt is measured, not consumed

Quando medimos, nenhum bot jamais tinha requisitado /llms.txt. Isso mudou por completo, embora não do jeito que os defensores do padrão gostariam. O arquivo é buscado continuamente, quase só por ferramentas que existem para verificar se você publica um.

Quem busca o llms.txtRequisições
Scripts genéricos (curl, node, axios)66
Scanners dedicados de llms.txt50
Sondas de pesquisa, incluindo um levantamento sobre injeção de prompt42
Crawlers de auditoria e prontidão para IA34
Startups de indexação33

Crawlers reconhecidos de grandes fornecedores vistos buscando o arquivo: CCBot, ClaudeBot, Googlebot e GoogleOther. Ausência notável: GPTBot.

Publicar llms.txt faz você ser medido pela indústria de ferramentas de visibilidade em IA. Ainda não faz você ser lido pelos laboratórios de fronteira.

Bytespider does not just check robots.txt

Este não escorregou, ele se inverteu. O Bytespider hoje é o terceiro crawler mais pesado da propriedade e 94% das suas requisições são de conteúdo.

BotTotalrobots.txtPáginasImagens
Bytespider16,8101,0864,8786,339
CCBot730706736

What Held Up

Seis dos insights originais atravessaram a janela mais longa intactos, e são justamente os que descrevem comportamento em vez de apontar um líder.

Conteúdo técnico conquista as citações. A descoberta mais robusta da lista original. Os doze principais destinos do ChatGPT-User são guias de implementação, comparações de ferramentas ou análises técnicas. Nada genérico, nada promocional. Um único guia de migração atraiu 6,716 requisições, 34% de todo o tráfego de ChatGPT-User da rede.

O GPTBot continua ignorando o robots.txt. Duas requisições a robots.txt contra 6,872 requisições de conteúdo. A Meta fez zero em 3,169.

As rajadas pioraram, não melhoraram. As taxas de pico hoje estão bem acima das 114 requisições por minuto reportadas originalmente.

Pico de requisições por minuto
Storebot-Google270
ChatGPT-User221
Googlebot172
DuckAssistBot152
Applebot132

Os fornecedores continuam operando frotas de bots, e nós subestimamos o número. A OpenAI opera pelo menos quatro crawlers distintos, incluindo um crawler de anúncios que publica a própria lista de faixas de IP. A Anthropic roda ClaudeBot, Claude-User e Claude-SearchBot. Três de cada um era o piso, não a contagem.

Eventos coordenados são reais. Confirmado na data exata que o post original citou: 19 de março mostra o GPTBot com 206 requisições e o OAI-SearchBot com 114, um de apenas dois dias em seis meses em que os dois passaram desses patamares juntos.

Os bots ainda têm pico em horas diferentes, e todas as horas mudaram. O GPTBot não tem mais pico às 04:00 UTC. Agora o pico é às 17:00, e ele é o crawler mais concentrado no tempo que medimos: 21.4% de todo o seu volume de seis meses cai nessa única hora do dia.

BotHora de pico (UTC)Fatia do seu tráfego nessa hora
GPTBot17:0021.4%
ChatGPT-User16:0010.1%
Bytespider19:009.0%
Applebot00:007.8%
bingbot03:006.5%

What We Could Not Test

Duas descobertas aparentes se revelaram artefatos da forma como os logs são coletados. Vale declarar as duas, porque cada uma poderia ter gerado uma manchete confiante que os dados não sustentam.

O robots.txt é invisível na propriedade de comparação. Ela retornou zero requisições a robots.txt de qualquer bot, o que parece uma descoberta dramática sobre conformidade e não é. Esse site serve o robots.txt na borda do CDN, então a requisição nunca chega à camada registrada. Todas as conclusões sobre robots.txt aqui vêm apenas da propriedade principal.

As descobertas sobre CSS e JavaScript não podem ser verificadas em nenhum sentido com estes dados. O sanitizador de logs remove .css, .js, fontes e source maps antes do armazenamento. Os insights 9 e 13 só podem ser testados nos seus componentes de imagem.

Duas ressalvas menores. O conjunto de dados abrange três propriedades relacionadas em vez de uma, e o conteúdo mais citado está em um único site dentro dessa rede, o que concentra as descobertas sobre citação. E julho é um mês parcial, até o dia 13, então os números de julho subestimam: a Meta chega ao primeiro lugar apesar disso.

Verifique o que o seu pipeline de logs descarta antes de tirar conclusões. Duas das nossas próprias descobertas eram artefatos do sanitizador.