Skip to main content

Publicamos 20 hallazgos sobre bots de IA. Seis meses después, el 65% había cambiado.

En marzo de 2026 publicamos 20 conclusiones sobre el comportamiento de los bots de IA a partir de 48 días de logs de servidor. Las volvimos a contrastar con seis meses de logs: 11 de las 17 que pudimos volver a comprobar habían cambiado, el 65% de la lista, en unos cinco meses. Seis quedaron superadas por el nuevo comportamiento de los crawlers, cinco se desplazaron de forma apreciable y seis siguen vigentes. Meta pasó de estar ausente a ser el crawler de IA más pesado en ocho semanas, la huella de IP de ChatGPT-User se invirtió, llms.txt ahora se solicita constantemente pero casi siempre por escáneres y no por los laboratorios de frontera, y Bytespider resultó ser el tercer crawler más pesado en lugar de un turista de robots.txt.

Seis meses de logs de servidor de bots de IA recontrastando veinte hallazgos anteriores sobre GPTBot, ChatGPT-User, ClaudeBot, meta-externalagent y Bytespider
Seis meses de logs de servidor de bots de IA recontrastando veinte hallazgos anteriores sobre GPTBot, ChatGPT-User, ClaudeBot, meta-externalagent y Bytespider
Qué cambió
  1. 55% of what we published had changed within five months. Once de los diecisiete hallazgos recomprobados se movieron: seis superados por el nuevo comportamiento de los crawlers y cinco desplazados de forma apreciable. Seis siguen vigentes. Recomprobados en tres propiedades entre el 1 de febrero y el 13 de julio de 2026, con su veredicto adjunto en cada caso.
  2. Rankings churn. Behaviours do not. El rastreo por ráfagas, los eventos coordinados por proveedor y el sesgo hacia el contenido técnico sobrevivieron a la ventana más larga. Todos los nombres de bot, ratios y horas pico concretos que publicamos se han movido. Cualquier cosa construida sobre una lista de bots del primer trimestre de 2026 ya está identificando mal el tráfico.
  3. Meta went from absent to the heaviest AI crawler in eight weeks. Cero solicitudes hasta mayo, luego 553 en junio y 2.615 en los primeros trece días de julio, sin una sola comprobación de robots.txt. En los seis meses completos sigue ocupando solo el duodécimo puesto, y por eso mismo un ranking de una sola ventana es mala base para decidir el presupuesto de rastreo.
  4. The IP fingerprint inverted.
    ChatGPT-User: casi 1:1 entonces, 12.4 solicitudes por IP ahora en 1.588 direcciones
    GPTBot: 2 IP entonces, 129 ahora
    La firma de casi 1:1 que describimos pertenece ahora a Claude-User, con 1.4. El método sigue funcionando; las huellas hay que volver a medirlas cada trimestre.
  5. llms.txt is measured, not consumed. Antes no lo pedía nadie, ahora se solicita de forma continua, pero de forma abrumadora por escáneres específicos, auditores de preparación para IA y sondas de investigación, no por los laboratorios de frontera. CCBot, ClaudeBot y Googlebot lo piden. GPTBot no.

Why We Re-Tested Our Own Insights

En marzo de 2026 publicamos veinte conclusiones sobre el comportamiento de los bots de IA, extraídas de 48 días de logs de servidor en una sola propiedad. Esto es lo que una ventana más larga y posterior hizo con ellas.

La investigación sobre bots envejece mal, y casi nunca se revisa. Queríamos saber cuánto, así que pasamos la lista original por seis meses de logs en tres propiedades y anotamos un veredicto para cada hallazgo. Diecisiete se pudieron recomprobar. Once se habían movido en cinco meses.

El artículo original sigue publicado tal cual: El tráfico de bots de IA se acelera rápido, el estudio de 48 días. Allí no se ha editado nada en silencio. Esta pieza es su auditoría.

The 20 Takeaways, Re-Tested Six Months Later

Cómo han envejecido los hallazgos originales · 11 de 17 cambiaron en cinco meses
6Superados
6Vigentes
5Desplazados

Superados y desplazados suman 11 de los 17 hallazgos, el 65% de la lista, en unos cinco meses. Cada veredicto describe lo que hizo después la población de crawlers, no un defecto de la medición original. Los veredictos salen de una ventana posterior y más larga: 154.864 solicitudes clasificadas en tres propiedades entre el 1 de febrero y el 13 de julio de 2026, contrastadas con una propiedad de ecommerce mayor.

  1. 01Desplazado

    Tu sitemap.xml acaba de ganar importancia. GPTBot y ClaudeBot llevaron el consumo de sitemaps a un umbral más alto en marzo de 2026 y no volvieron atrás. Si tu sitemap está desactualizado, incompleto o le faltan variantes de idioma, los crawlers de IA se perderán contenido.

    Seis meses después a 20/07/26El consumo de sitemaps volvió a subir y se mantuvo ahí. ClaudeBot es ahora el consumidor dominante por amplio margen, unas 6x Googlebot, y ambos bots ya pedían sitemaps en febrero, así que marzo marcó una escalada y no un comienzo.

  2. 02Vigente

    robots.txt no se respeta de forma universal. GPTBot y Meta-WebIndexer no lo consultan nunca. Si tu estrategia de contenido para IA depende de las directivas de robots.txt, ten presente que dos de los crawlers más activos las ignoran por completo.

    Seis meses después a 20/07/26GPTBot hizo 2 solicitudes de robots.txt frente a 6.872 solicitudes de contenido. Meta hizo cero en 3.169. Confirmado en ambos.

  3. 03Superado

    El tráfico de ChatGPT-User es una señal directa de citación de marca en conversaciones con IA. Cada solicitud representa a una persona real pegando tu URL en ChatGPT. Es boca a boca medible, y crece rápido.

    Seis meses después a 20/07/26Sube un 11% en cinco meses con una caída en medio: 3.827 en febrero frente a 4.236 en junio. La señal es real, y el crecimiento se aplanó después de la ventana que medimos.

  4. 04Vigente

    Los bots de IA rastrean en ráfagas, no en flujos constantes. GPTBot alcanzó 114 sol/min en una ventana de 3 minutos. Si tu servidor no aguanta el tráfico en ráfaga, los crawlers de IA pueden verse limitados o encontrar errores durante sus pasadas de indexación.

    Seis meses después a 20/07/26Confirmado e intensificado. El pico es ahora de 270 solicitudes por minuto, con cuatro bots por encima de 130.

  5. 05Vigente

    OpenAI y Anthropic operan 3 bots distintos cada uno. Uno para entrenamiento e indexación, uno para búsqueda y uno para sesiones de usuario en vivo. Bloquear uno no bloquea los demás. Tu robots.txt necesita directivas separadas para cada uno.

    Seis meses después a 20/07/26Es un suelo, no un techo. OpenAI opera ahora al menos cuatro, incluido un crawler de publicidad que publica su propia lista de rangos de IP. Tres cada uno es un mínimo, no un recuento.

  6. 06Superado

    OAI-SearchBot y Googlebot son los únicos bots que descargan imágenes en volumen. Si las imágenes de tus artículos llevan contenido con sentido (gráficos, diagramas, visualizaciones de datos), estos son los bots que las usarán en resultados de búsqueda.

    Seis meses después a 20/07/26Seis bots descargan ahora una proporción de imágenes mayor que Googlebot. Los dos nombrados aquí ocupan los puestos 7 y 10. Descargar imágenes es habitual en toda la población de crawlers.

  7. 07Desplazado

    ChatGPT-User solo extrae texto. Cero imágenes, cero CSS, cero JS. Tu contenido HTML es lo que entra en las conversaciones con IA. El texto estructurado y claro importa más que el diseño visual para la visibilidad en IA.

    Seis meses después a 20/07/26Cerca, pero ya no es cero: 1,9% imágenes frente a 95,3% páginas. La parte de CSS y JavaScript no se puede comprobar, porque el pipeline de logs descarta esos archivos antes de almacenarlos.

  8. 08Desplazado

    Los crawlers de IA tienen su pico a horas distintas. GPTBot golpea a las 04:00 UTC. Claude-SearchBot alcanza su pico de madrugada. PerplexityBot dispara ráfagas a las 23:00, 05:00 y 09:00. Si despliegas cambios del sitio en horas valle de EE. UU., puede que los bots de IA sean los primeros en verlos.

    Seis meses después a 20/07/26El patrón se mantiene y todas las horas concretas se han movido. GPTBot ahora tiene su pico a las 17:00 UTC, y es el crawler más concentrado en el tiempo que hemos medido, con el 21,4% de todo su volumen dentro de esa única hora.

  9. 09Desplazado

    Meta es el crawler de IA más agresivo por volumen. Meta-WebIndexer envió más solicitudes que ningún otro bot de este conjunto de datos, con cero comprobaciones de robots.txt. Si no sigues a los crawlers de Meta, te estás perdiendo al mayor actor.

    Seis meses después a 20/07/26Este iba por delante de los datos cuando se escribió y ahora los datos lo están alcanzando. En los seis meses completos Meta ocupa el puesto 12. En julio es el crawler de IA más pesado de la propiedad, después de estar completamente ausente hasta mayo.

  10. 10Superado

    La adopción de llms.txt sigue siendo teórica. Cero bots de IA solicitaron /llms.txt en 48 días. Puede que acabe siendo un estándar, pero hoy ningún crawler lo busca.

    Seis meses después a 20/07/26Desde entonces ha empezado a solicitarse de forma continua, pero de forma abrumadora por escáneres, auditores y sondas de investigación, no por los laboratorios de frontera. CCBot, ClaudeBot y Googlebot lo piden. GPTBot no.

  11. 11Desplazado

    Applebot renderiza tus páginas por completo. Descarga CSS, JS e imágenes (47% de su tráfico). Si tu contenido necesita renderizado con JavaScript para estar completo, Applebot lo verá, pero la mayoría de bots de IA no.

    Seis meses después a 20/07/26La dirección es correcta, la magnitud es bastante menor: las imágenes son el 27,6% del tráfico de Applebot, frente al 47% de entonces. La parte de CSS y JavaScript no es comprobable aquí, por el mismo motivo de pipeline que en el hallazgo 9 de arriba.

  12. 12Vigente

    El contenido técnico y práctico es el más referenciado en conversaciones con IA. Las páginas principales de ChatGPT-User eran todas guías de implementación y explicaciones técnicas. El contenido profundo y específico se gana las citas de la IA.

    Seis meses después a 20/07/26El hallazgo más sólido de la lista original. Los doce destinos principales son guías de implementación, comparativas de herramientas o análisis técnicos. Nada genérico, nada promocional. Una sola guía de migración atrajo el 34% de todo el tráfico de ChatGPT-User a la red.

  13. 13Superado

    Bytespider y CCBot solo consultan robots.txt y nunca rastrean. Consumen tus directivas de robots.txt sin llegar a actuar. Esto puede cambiar, pero hoy generan carga de cumplimiento con cero indexación de contenido.

    Seis meses después a 20/07/26Se ha invertido desde que medimos. Bytespider es ahora el tercer crawler más pesado de la propiedad, y el 94% de sus 16.810 solicitudes son contenido, no cumplimiento.

  14. 14Vigente

    El volumen de rastreo de IA puede cambiar de un día para otro. GPTBot pasó de 0 a 187 solicitudes en una sola semana. Tus proyecciones de presupuesto de rastreo tienen que contemplar saltos bruscos, no crecimiento gradual.

    Seis meses después a 20/07/26Confirmado, con un ejemplo más limpio que el citado originalmente. Meta pasó de cero a 2.615 solicitudes al mes en unas ocho semanas.

  15. 15Superado

    El análisis de IP revela la identidad del bot. La ratio de casi 1:1 entre IP y solicitudes de ChatGPT-User demuestra sesiones de usuario individuales. Las 2 IP de GPTBot demuestran infraestructura centralizada. Los patrones de IP ayudan a distinguir las descargas provocadas por usuarios reales del rastreo automatizado.

    Seis meses después a 20/07/26El método sobrevive y todas sus cifras se han movido. ChatGPT-User marca ahora 12.4 solicitudes por IP en 1.588 direcciones. GPTBot opera con 129 IP, no con 2. La huella de casi 1:1 descrita aquí pertenece ahora a Claude-User, con 1.4.

  16. 16Vigente

    Los eventos de rastreo coordinados ocurren entre familias de bots. GPTBot y OAI-SearchBot se dispararon a la vez el 19 de marzo desde la misma infraestructura de Microsoft. Cuando un bot de OpenAI acelera, espera que los demás sigan.

    Seis meses después a 20/07/26Confirmado de forma independiente en la fecha exacta citada, uno de los dos únicos días en seis meses en que ambos bots superaron esos umbrales a la vez.

  17. 17Superado

    Los bots de los que nunca has oído hablar ya te están visitando. PromptingBot, LinkupBot, Brightbot, Observer y otros rastrean contenido activamente. El panorama de bots de IA es más amplio de lo que sugieren los nombres conocidos.

    Seis meses después a 20/07/26Los cuatro bots nombrados hicieron cero solicitudes en los nuevos seis meses. La idea de fondo sobrevive con un reparto completamente distinto: la cola larga la dominan ahora los escáneres de llms.txt y los auditores de preparación para IA. Cualquier lista con nombres tiene una vida útil de meses.

This data is representative of wislr.com only and should not be read as an overall industry trend. Our intent is to spark conversation, share data, and encourage brands to inspect this for themselves.


What Six Months of Logs Changed

El estudio original duró 48 días en una sola propiedad. Esta recomprobación cubre 154.864 solicitudes clasificadas en tres propiedades entre el 1 de febrero y el 13 de julio de 2026, contrastadas con una propiedad de ecommerce mayor con 7,26 millones de solicitudes, con la identidad del bot resuelta por user-agent contra una tabla de referencia de 75 patrones.

Cómo leer las fuentes de aquí

El estudio original de 48 días cubría un sitio y así lo decía. Esta recomprobación abarca tres propiedades que operamos, etiquetadas Sitio A, Sitio B y Sitio C, más una propiedad mayor de comparación. No vinculamos las etiquetas con dominios, así que las cifras de seis meses se reportan sin atribución.

Once de los diecisiete hallazgos que pudimos recomprobar se movieron en cinco meses, seis superados por el nuevo comportamiento de los crawlers y cinco desplazados de forma apreciable. Esa tasa es el hallazgo. El patrón que hay debajo importa más que cualquier corrección concreta: los comportamientos se mantuvieron y los números se movieron. Ráfagas, eventos coordinados por proveedor, sesgo hacia el contenido técnico, todo sigue ahí. Todos los nombres de bot, ratios y horas pico concretos que publicamos han cambiado.

Los rankings son inestables. Los comportamientos son estables. Cualquier cosa que construyeras sobre una lista de bots del primer trimestre de 2026 ya está identificando mal el tráfico.

Meta went from absent to first in eight weeks

El mayor cambio del conjunto de datos. meta-externalagent no registró absolutamente nada hasta mayo, una única solicitud ese mes, luego 553 en junio y 2.615 en los primeros trece días de julio. Ahora es el crawler de IA más pesado de la propiedad, y julio es un mes parcial, así que esa cifra se queda corta.

Solicitudes mensuales: la función escalón de Meta frente a un ChatGPT-User plano
De feb a jul de 2026 · julio es parcial, hasta el día 13
meta-externalagentChatGPT-User

En los seis meses completos Meta ocupa el duodécimo puesto. En julio ocupa el primero. Ambas afirmaciones son ciertas, y por eso mismo un ranking de una sola ventana es mala base para decidir el presupuesto de rastreo. Además hizo cero solicitudes de robots.txt en 3.169 impactos.

The bot rankings churn, the behaviours do not

Catorce bots con volumen suficiente para seguirlos mes a mes. Fíjate en lo poco que se parece a sí misma la forma de la población de febrero a julio.

Todos los bots rastreados, mes a mes
Ordenados por volumen a seis meses · cada panel escalado a su propio máximo · Meta en rojo

The IP fingerprint inverted

La lectura original usaba las solicitudes por IP para separar las descargas provocadas por usuarios del rastreo centralizado. El método sigue funcionando. Todas sus cifras se han movido.

Solicitudes por IP distinta
PerplexityBot90.2
GPTBot53.3
ClaudeBot41.4
ChatGPT-User12.4
Claude-User1.4

ChatGPT-User estaba cerca de 1:1 en la ventana original y ahora marca 12.4 solicitudes por IP en 1.588 direcciones: OpenAI ha consolidado ese tráfico detrás de menos IP de salida, más cargadas. GPTBot opera con 129 IP, no con las 2 que reportamos. La firma de casi 1:1 que describimos pertenece ahora a Claude-User.

El método sigue funcionando. Las huellas hay que volver a medirlas cada trimestre.

Image fetching is now common

Cuando medimos, OAI-SearchBot y Googlebot eran los únicos bots que descargaban imágenes en volumen. Desde entonces la descarga de imágenes se ha extendido por toda la población de crawlers: seis bots descargan ahora una proporción mayor que Googlebot, y los dos nombrados originalmente ocupan los puestos séptimo y décimo.

Imágenes como proporción del total de solicitudes de ese bot
Storebot-Google53.5%
TikTokSpider41.4%
Bytespider37.7%
DuckDuckBot33.8%
Applebot27.6%
GoogleOther26.7%
Googlebot18.4%
GPTBot16.5%
bingbot16.0%
OAI-SearchBot12.6%

Las filas resaltadas son los dos bots que nombramos originalmente como los únicos que descargaban imágenes en volumen.

llms.txt is measured, not consumed

Cuando medimos, ningún bot había solicitado nunca /llms.txt. Eso ha cambiado por completo, aunque no como querrían los defensores del estándar. Se solicita de forma continua, casi siempre por herramientas que existen para comprobar si publicas uno.

Quién solicita llms.txtSolicitudes
Scripts genéricos (curl, node, axios)66
Escáneres específicos de llms.txt50
Sondas de investigación, incluida una encuesta sobre inyección de prompts42
Crawlers de auditoría y preparación para IA34
Startups de indexación33

Crawlers reconocidos de grandes proveedores a los que se ha visto pedirlo: CCBot, ClaudeBot, Googlebot y GoogleOther. Ausencia notable: GPTBot.

Publicar llms.txt hace que te mida la industria de herramientas de visibilidad en IA. Todavía no hace que te lean los laboratorios de frontera.

Bytespider does not just check robots.txt

Este no se desvió, se invirtió. Bytespider es ahora el tercer crawler más pesado de la propiedad y el 94% de sus solicitudes son contenido.

BotTotalrobots.txtPáginasImágenes
Bytespider16,8101,0864,8786,339
CCBot730706736

What Held Up

Seis de los hallazgos originales sobrevivieron intactos a la ventana más larga, y son los que describen comportamiento en lugar de nombrar a un líder.

El contenido técnico se gana las citas. El hallazgo más sólido de la lista original. Los doce destinos principales de ChatGPT-User son guías de implementación, comparativas de herramientas o análisis técnicos. Nada genérico, nada promocional. Una sola guía de migración atrajo 6.716 solicitudes, el 34% de todo el tráfico de ChatGPT-User de la red.

GPTBot sigue ignorando robots.txt. Dos solicitudes de robots.txt frente a 6.872 solicitudes de contenido. Meta hizo cero en 3.169.

Las ráfagas empeoraron, no mejoraron. Las tasas pico están ahora muy por encima de las 114 solicitudes por minuto reportadas originalmente.

Solicitudes pico por minuto
Storebot-Google270
ChatGPT-User221
Googlebot172
DuckAssistBot152
Applebot132

Los proveedores siguen operando flotas de bots, y nos quedamos cortos al contarlas. OpenAI opera al menos cuatro crawlers distintos, incluido un crawler de publicidad que publica su propia lista de rangos de IP. Anthropic opera ClaudeBot, Claude-User y Claude-SearchBot. Tres cada uno era un suelo, no un recuento.

Los eventos coordinados son reales. Confirmado en la fecha exacta que citaba el artículo original: el 19 de marzo muestra a GPTBot con 206 solicitudes y a OAI-SearchBot con 114, uno de los dos únicos días en seis meses en que ambos superaron esos umbrales a la vez.

Los bots siguen teniendo picos a horas distintas, y todas las horas se movieron. GPTBot ya no tiene su pico a las 04:00 UTC. Ahora lo tiene a las 17:00, y es el crawler más concentrado en el tiempo que hemos medido: el 21,4% de todo su volumen de seis meses cae en esa única hora del día.

BotHora pico (UTC)Proporción de su tráfico en esa hora
GPTBot17:0021.4%
ChatGPT-User16:0010.1%
Bytespider19:009.0%
Applebot00:007.8%
bingbot03:006.5%

What We Could Not Test

Dos hallazgos aparentes resultaron ser artefactos de cómo se recogen los logs. Los dos merecen decirse, porque cada uno podría haber producido un titular rotundo que los datos no sostienen.

robots.txt es invisible en la propiedad de comparación. Devolvió cero solicitudes de robots.txt de cualquier bot, lo que parece un hallazgo espectacular sobre cumplimiento y no lo es. Ese sitio sirve robots.txt desde el borde del CDN, así que la solicitud nunca llega a la capa registrada. Todas las conclusiones sobre robots.txt de aquí salen únicamente de la propiedad principal.

Los hallazgos sobre CSS y JavaScript no se pueden comprobar en ningún sentido con estos datos. El saneador de logs descarta .css, .js, fuentes y source maps antes de almacenarlos. Los hallazgos 9 y 13 solo se pueden probar en su componente de imágenes.

Dos cautelas menores. El conjunto de datos abarca tres propiedades relacionadas en lugar de una, y el contenido más citado está en un solo sitio dentro de esa red, lo que concentra los hallazgos sobre citación. Y julio es un mes parcial, hasta el día 13, así que las cifras de julio se quedan cortas: Meta llega al primer puesto pese a eso.

Comprueba qué descarta tu pipeline de logging antes de sacar conclusiones. Dos de nuestros propios hallazgos eran artefactos del saneador.