Why We Re-Tested Our Own Insights
En marzo de 2026 publicamos veinte conclusiones sobre el comportamiento de los bots de IA, extraídas de 48 días de logs de servidor en una sola propiedad. Esto es lo que una ventana más larga y posterior hizo con ellas.
La investigación sobre bots envejece mal, y casi nunca se revisa. Queríamos saber cuánto, así que pasamos la lista original por seis meses de logs en tres propiedades y anotamos un veredicto para cada hallazgo. Diecisiete se pudieron recomprobar. Once se habían movido en cinco meses.
El artículo original sigue publicado tal cual: El tráfico de bots de IA se acelera rápido, el estudio de 48 días. Allí no se ha editado nada en silencio. Esta pieza es su auditoría.
The 20 Takeaways, Re-Tested Six Months Later
Superados y desplazados suman 11 de los 17 hallazgos, el 65% de la lista, en unos cinco meses. Cada veredicto describe lo que hizo después la población de crawlers, no un defecto de la medición original. Los veredictos salen de una ventana posterior y más larga: 154.864 solicitudes clasificadas en tres propiedades entre el 1 de febrero y el 13 de julio de 2026, contrastadas con una propiedad de ecommerce mayor.
- 01Desplazado
Tu sitemap.xml acaba de ganar importancia. GPTBot y ClaudeBot llevaron el consumo de sitemaps a un umbral más alto en marzo de 2026 y no volvieron atrás. Si tu sitemap está desactualizado, incompleto o le faltan variantes de idioma, los crawlers de IA se perderán contenido.
Seis meses después a 20/07/26El consumo de sitemaps volvió a subir y se mantuvo ahí. ClaudeBot es ahora el consumidor dominante por amplio margen, unas 6x Googlebot, y ambos bots ya pedían sitemaps en febrero, así que marzo marcó una escalada y no un comienzo.
- 02Vigente
robots.txt no se respeta de forma universal. GPTBot y Meta-WebIndexer no lo consultan nunca. Si tu estrategia de contenido para IA depende de las directivas de robots.txt, ten presente que dos de los crawlers más activos las ignoran por completo.
Seis meses después a 20/07/26GPTBot hizo 2 solicitudes de robots.txt frente a 6.872 solicitudes de contenido. Meta hizo cero en 3.169. Confirmado en ambos.
- 03Superado
El tráfico de ChatGPT-User es una señal directa de citación de marca en conversaciones con IA. Cada solicitud representa a una persona real pegando tu URL en ChatGPT. Es boca a boca medible, y crece rápido.
Seis meses después a 20/07/26Sube un 11% en cinco meses con una caída en medio: 3.827 en febrero frente a 4.236 en junio. La señal es real, y el crecimiento se aplanó después de la ventana que medimos.
- 04Vigente
Los bots de IA rastrean en ráfagas, no en flujos constantes. GPTBot alcanzó 114 sol/min en una ventana de 3 minutos. Si tu servidor no aguanta el tráfico en ráfaga, los crawlers de IA pueden verse limitados o encontrar errores durante sus pasadas de indexación.
Seis meses después a 20/07/26Confirmado e intensificado. El pico es ahora de 270 solicitudes por minuto, con cuatro bots por encima de 130.
- 05Vigente
OpenAI y Anthropic operan 3 bots distintos cada uno. Uno para entrenamiento e indexación, uno para búsqueda y uno para sesiones de usuario en vivo. Bloquear uno no bloquea los demás. Tu robots.txt necesita directivas separadas para cada uno.
Seis meses después a 20/07/26Es un suelo, no un techo. OpenAI opera ahora al menos cuatro, incluido un crawler de publicidad que publica su propia lista de rangos de IP. Tres cada uno es un mínimo, no un recuento.
- 06Superado
OAI-SearchBot y Googlebot son los únicos bots que descargan imágenes en volumen. Si las imágenes de tus artículos llevan contenido con sentido (gráficos, diagramas, visualizaciones de datos), estos son los bots que las usarán en resultados de búsqueda.
Seis meses después a 20/07/26Seis bots descargan ahora una proporción de imágenes mayor que Googlebot. Los dos nombrados aquí ocupan los puestos 7 y 10. Descargar imágenes es habitual en toda la población de crawlers.
- 07Desplazado
ChatGPT-User solo extrae texto. Cero imágenes, cero CSS, cero JS. Tu contenido HTML es lo que entra en las conversaciones con IA. El texto estructurado y claro importa más que el diseño visual para la visibilidad en IA.
Seis meses después a 20/07/26Cerca, pero ya no es cero: 1,9% imágenes frente a 95,3% páginas. La parte de CSS y JavaScript no se puede comprobar, porque el pipeline de logs descarta esos archivos antes de almacenarlos.
- 08Desplazado
Los crawlers de IA tienen su pico a horas distintas. GPTBot golpea a las 04:00 UTC. Claude-SearchBot alcanza su pico de madrugada. PerplexityBot dispara ráfagas a las 23:00, 05:00 y 09:00. Si despliegas cambios del sitio en horas valle de EE. UU., puede que los bots de IA sean los primeros en verlos.
Seis meses después a 20/07/26El patrón se mantiene y todas las horas concretas se han movido. GPTBot ahora tiene su pico a las 17:00 UTC, y es el crawler más concentrado en el tiempo que hemos medido, con el 21,4% de todo su volumen dentro de esa única hora.
- 09Desplazado
Meta es el crawler de IA más agresivo por volumen. Meta-WebIndexer envió más solicitudes que ningún otro bot de este conjunto de datos, con cero comprobaciones de robots.txt. Si no sigues a los crawlers de Meta, te estás perdiendo al mayor actor.
Seis meses después a 20/07/26Este iba por delante de los datos cuando se escribió y ahora los datos lo están alcanzando. En los seis meses completos Meta ocupa el puesto 12. En julio es el crawler de IA más pesado de la propiedad, después de estar completamente ausente hasta mayo.
- 10Superado
La adopción de llms.txt sigue siendo teórica. Cero bots de IA solicitaron /llms.txt en 48 días. Puede que acabe siendo un estándar, pero hoy ningún crawler lo busca.
Seis meses después a 20/07/26Desde entonces ha empezado a solicitarse de forma continua, pero de forma abrumadora por escáneres, auditores y sondas de investigación, no por los laboratorios de frontera. CCBot, ClaudeBot y Googlebot lo piden. GPTBot no.
- 11Desplazado
Applebot renderiza tus páginas por completo. Descarga CSS, JS e imágenes (47% de su tráfico). Si tu contenido necesita renderizado con JavaScript para estar completo, Applebot lo verá, pero la mayoría de bots de IA no.
Seis meses después a 20/07/26La dirección es correcta, la magnitud es bastante menor: las imágenes son el 27,6% del tráfico de Applebot, frente al 47% de entonces. La parte de CSS y JavaScript no es comprobable aquí, por el mismo motivo de pipeline que en el hallazgo 9 de arriba.
- 12Vigente
El contenido técnico y práctico es el más referenciado en conversaciones con IA. Las páginas principales de ChatGPT-User eran todas guías de implementación y explicaciones técnicas. El contenido profundo y específico se gana las citas de la IA.
Seis meses después a 20/07/26El hallazgo más sólido de la lista original. Los doce destinos principales son guías de implementación, comparativas de herramientas o análisis técnicos. Nada genérico, nada promocional. Una sola guía de migración atrajo el 34% de todo el tráfico de ChatGPT-User a la red.
- 13Superado
Bytespider y CCBot solo consultan robots.txt y nunca rastrean. Consumen tus directivas de robots.txt sin llegar a actuar. Esto puede cambiar, pero hoy generan carga de cumplimiento con cero indexación de contenido.
Seis meses después a 20/07/26Se ha invertido desde que medimos. Bytespider es ahora el tercer crawler más pesado de la propiedad, y el 94% de sus 16.810 solicitudes son contenido, no cumplimiento.
- 14Vigente
El volumen de rastreo de IA puede cambiar de un día para otro. GPTBot pasó de 0 a 187 solicitudes en una sola semana. Tus proyecciones de presupuesto de rastreo tienen que contemplar saltos bruscos, no crecimiento gradual.
Seis meses después a 20/07/26Confirmado, con un ejemplo más limpio que el citado originalmente. Meta pasó de cero a 2.615 solicitudes al mes en unas ocho semanas.
- 15Superado
El análisis de IP revela la identidad del bot. La ratio de casi 1:1 entre IP y solicitudes de ChatGPT-User demuestra sesiones de usuario individuales. Las 2 IP de GPTBot demuestran infraestructura centralizada. Los patrones de IP ayudan a distinguir las descargas provocadas por usuarios reales del rastreo automatizado.
Seis meses después a 20/07/26El método sobrevive y todas sus cifras se han movido. ChatGPT-User marca ahora 12.4 solicitudes por IP en 1.588 direcciones. GPTBot opera con 129 IP, no con 2. La huella de casi 1:1 descrita aquí pertenece ahora a Claude-User, con 1.4.
- 16Vigente
Los eventos de rastreo coordinados ocurren entre familias de bots. GPTBot y OAI-SearchBot se dispararon a la vez el 19 de marzo desde la misma infraestructura de Microsoft. Cuando un bot de OpenAI acelera, espera que los demás sigan.
Seis meses después a 20/07/26Confirmado de forma independiente en la fecha exacta citada, uno de los dos únicos días en seis meses en que ambos bots superaron esos umbrales a la vez.
- 17Superado
Los bots de los que nunca has oído hablar ya te están visitando. PromptingBot, LinkupBot, Brightbot, Observer y otros rastrean contenido activamente. El panorama de bots de IA es más amplio de lo que sugieren los nombres conocidos.
Seis meses después a 20/07/26Los cuatro bots nombrados hicieron cero solicitudes en los nuevos seis meses. La idea de fondo sobrevive con un reparto completamente distinto: la cola larga la dominan ahora los escáneres de llms.txt y los auditores de preparación para IA. Cualquier lista con nombres tiene una vida útil de meses.
This data is representative of wislr.com only and should not be read as an overall industry trend. Our intent is to spark conversation, share data, and encourage brands to inspect this for themselves.
What Six Months of Logs Changed
El estudio original duró 48 días en una sola propiedad. Esta recomprobación cubre 154.864 solicitudes clasificadas en tres propiedades entre el 1 de febrero y el 13 de julio de 2026, contrastadas con una propiedad de ecommerce mayor con 7,26 millones de solicitudes, con la identidad del bot resuelta por user-agent contra una tabla de referencia de 75 patrones.
El estudio original de 48 días cubría un sitio y así lo decía. Esta recomprobación abarca tres propiedades que operamos, etiquetadas Sitio A, Sitio B y Sitio C, más una propiedad mayor de comparación. No vinculamos las etiquetas con dominios, así que las cifras de seis meses se reportan sin atribución.
Once de los diecisiete hallazgos que pudimos recomprobar se movieron en cinco meses, seis superados por el nuevo comportamiento de los crawlers y cinco desplazados de forma apreciable. Esa tasa es el hallazgo. El patrón que hay debajo importa más que cualquier corrección concreta: los comportamientos se mantuvieron y los números se movieron. Ráfagas, eventos coordinados por proveedor, sesgo hacia el contenido técnico, todo sigue ahí. Todos los nombres de bot, ratios y horas pico concretos que publicamos han cambiado.
Meta went from absent to first in eight weeks
El mayor cambio del conjunto de datos. meta-externalagent no registró absolutamente nada hasta mayo, una única solicitud ese mes, luego 553 en junio y 2.615 en los primeros trece días de julio. Ahora es el crawler de IA más pesado de la propiedad, y julio es un mes parcial, así que esa cifra se queda corta.
En los seis meses completos Meta ocupa el duodécimo puesto. En julio ocupa el primero. Ambas afirmaciones son ciertas, y por eso mismo un ranking de una sola ventana es mala base para decidir el presupuesto de rastreo. Además hizo cero solicitudes de robots.txt en 3.169 impactos.
The bot rankings churn, the behaviours do not
Catorce bots con volumen suficiente para seguirlos mes a mes. Fíjate en lo poco que se parece a sí misma la forma de la población de febrero a julio.
The IP fingerprint inverted
La lectura original usaba las solicitudes por IP para separar las descargas provocadas por usuarios del rastreo centralizado. El método sigue funcionando. Todas sus cifras se han movido.
Image fetching is now common
Cuando medimos, OAI-SearchBot y Googlebot eran los únicos bots que descargaban imágenes en volumen. Desde entonces la descarga de imágenes se ha extendido por toda la población de crawlers: seis bots descargan ahora una proporción mayor que Googlebot, y los dos nombrados originalmente ocupan los puestos séptimo y décimo.
llms.txt is measured, not consumed
Cuando medimos, ningún bot había solicitado nunca /llms.txt. Eso ha cambiado por completo, aunque no como querrían los defensores del estándar. Se solicita de forma continua, casi siempre por herramientas que existen para comprobar si publicas uno.
Crawlers reconocidos de grandes proveedores a los que se ha visto pedirlo: CCBot, ClaudeBot, Googlebot y GoogleOther. Ausencia notable: GPTBot.
Bytespider does not just check robots.txt
Este no se desvió, se invirtió. Bytespider es ahora el tercer crawler más pesado de la propiedad y el 94% de sus solicitudes son contenido.
What Held Up
Seis de los hallazgos originales sobrevivieron intactos a la ventana más larga, y son los que describen comportamiento en lugar de nombrar a un líder.
El contenido técnico se gana las citas. El hallazgo más sólido de la lista original. Los doce destinos principales de ChatGPT-User son guías de implementación, comparativas de herramientas o análisis técnicos. Nada genérico, nada promocional. Una sola guía de migración atrajo 6.716 solicitudes, el 34% de todo el tráfico de ChatGPT-User de la red.
GPTBot sigue ignorando robots.txt. Dos solicitudes de robots.txt frente a 6.872 solicitudes de contenido. Meta hizo cero en 3.169.
Las ráfagas empeoraron, no mejoraron. Las tasas pico están ahora muy por encima de las 114 solicitudes por minuto reportadas originalmente.
Los proveedores siguen operando flotas de bots, y nos quedamos cortos al contarlas. OpenAI opera al menos cuatro crawlers distintos, incluido un crawler de publicidad que publica su propia lista de rangos de IP. Anthropic opera ClaudeBot, Claude-User y Claude-SearchBot. Tres cada uno era un suelo, no un recuento.
Los eventos coordinados son reales. Confirmado en la fecha exacta que citaba el artículo original: el 19 de marzo muestra a GPTBot con 206 solicitudes y a OAI-SearchBot con 114, uno de los dos únicos días en seis meses en que ambos superaron esos umbrales a la vez.
Los bots siguen teniendo picos a horas distintas, y todas las horas se movieron. GPTBot ya no tiene su pico a las 04:00 UTC. Ahora lo tiene a las 17:00, y es el crawler más concentrado en el tiempo que hemos medido: el 21,4% de todo su volumen de seis meses cae en esa única hora del día.
What We Could Not Test
Dos hallazgos aparentes resultaron ser artefactos de cómo se recogen los logs. Los dos merecen decirse, porque cada uno podría haber producido un titular rotundo que los datos no sostienen.
robots.txt es invisible en la propiedad de comparación. Devolvió cero solicitudes de robots.txt de cualquier bot, lo que parece un hallazgo espectacular sobre cumplimiento y no lo es. Ese sitio sirve robots.txt desde el borde del CDN, así que la solicitud nunca llega a la capa registrada. Todas las conclusiones sobre robots.txt de aquí salen únicamente de la propiedad principal.
Los hallazgos sobre CSS y JavaScript no se pueden comprobar en ningún sentido con estos datos. El saneador de logs descarta .css, .js, fuentes y source maps antes de almacenarlos. Los hallazgos 9 y 13 solo se pueden probar en su componente de imágenes.
Dos cautelas menores. El conjunto de datos abarca tres propiedades relacionadas en lugar de una, y el contenido más citado está en un solo sitio dentro de esa red, lo que concentra los hallazgos sobre citación. Y julio es un mes parcial, hasta el día 13, así que las cifras de julio se quedan cortas: Meta llega al primer puesto pese a eso.