Semana del 3 de agosto de 2026
¿A quién creen que engañan estos bots?
Casi todo lo que se escribe sobre los rastreadores de IA procede de anuncios de proveedores y no de registros. Estas preguntas vienen de ambos: registros de edge reales de una tienda de ecommerce de tamaño medio y la documentación de rastreo que publican las propias empresas de IA. Responde cada una y la evidencia aparece al instante.
- Preguntas
- 10
- Minutos
- 6
-
1
En la última semana, ¿qué bot solicitó /sitemap.xml con más frecuencia?
Bingbot, de Microsoft
Bingbot lo solicitó docenas de veces. Los rastreadores reales de GPTBot, ClaudeBot, PerplexityBot y Gemini lo solicitaron cero veces, pese a hacer miles de peticiones al mismo sitio. Los rastreadores de IA descubren contenido de forma abrumadora siguiendo enlaces, no leyendo sitemaps. Enviar un sitemap es un ritual de los motores de búsqueda; hace muy poco por la visibilidad en IA, hasta donde sabemos.
-
2
¿Qué es Google-Extended?
Un token de robots.txt que controla si el contenido rastreado entrena y fundamenta a Gemini
Nunca hace una petición. Google indica que Google-Extended no tiene un user agent propio, así que el rastreo se sigue produciendo a través de los rastreadores normales de Google y el token solo gobierna lo que ocurre con ese contenido después: entrenar futuros modelos Gemini y fundamentar las respuestas en Gemini Apps y Vertex AI. Google también es explícito al decir que no afecta a la inclusión de un sitio en su buscador y que no es una señal de posicionamiento, así que bloquearlo no cuesta nada en búsqueda y no reducirá tu tráfico de rastreo ni en una sola petición.
-
3
¿Cuál es la única forma fiable de confirmar que una petición vino realmente de GPTBot?
DNS inverso más los rangos de IP publicados por el proveedor
Las cadenas de user-agent son texto libre. Cualquiera puede enviar la que quiera, y muchos escáneres lo hacen.
-
4
Para un editor típico, ¿qué actividad de OpenAI genera más peticiones?
ChatGPT-User obteniendo una página porque una persona ha preguntado por ella
Las obtenciones iniciadas por usuarios superaron a los rastreos de entrenamiento en una proporción aproximada de seis a uno. La mayor parte del tráfico de bots de IA no es entrenamiento, es la pregunta de una persona real respondiéndose en tiempo real.
-
5
Tus registros muestran tráfico etiquetado como OpenAI desde una IP de Google Cloud. ¿Cuál es la explicación más probable?
Un user-agent falsificado
Detectamos exactamente esto: un escáner situado en una única red de Google Cloud envió muy por encima de mil peticiones en 72 horas, rotando entre user-agents de OpenAI, Perplexity y Gemini, y pidiendo una sola URL por ruta. Eso es enumeración, no rastreo. Los rastreadores reales de OpenAI salen desde Azure.
-
6
¿Qué describe mejor la forma en que las grandes empresas de IA rastrean la web?
Cada empresa opera varios bots distintos con funciones diferentes
La propia documentación de OpenAI enumera cuatro: GPTBot para datos de entrenamiento, ChatGPT-User para una obtención en vivo cuando pregunta una persona, OAI-SearchBot para los resultados de búsqueda de ChatGPT y OAI-AdsBot para revisar las páginas enviadas como anuncios. Anthropic y las demás siguen el mismo patrón. OpenAI afirma que cada ajuste es independiente, así que un editor puede permitir OAI-SearchBot para aparecer en la búsqueda y bloquear GPTBot al mismo tiempo. Eso significa que "¿debería permitir los bots de IA?" no es una decisión, son cuatro.
-
7
Añades User-agent: GPTBot con Disallow: / a tu robots.txt. ¿Qué sigue llegando a tu sitio?
ChatGPT-User y OAI-SearchBot
Bloquear un token bloquea un bot. OpenAI afirma que cada ajuste es independiente, así que el rastreador de búsqueda, el de anuncios y la obtención en vivo del usuario siguen funcionando. ChatGPT-User es el incómodo: como esas peticiones las inicia una persona y no una programación de rastreo, OpenAI señala que puede que las reglas de robots.txt no se le apliquen en absoluto. La mayoría de las configuraciones del tipo "hemos bloqueado la IA" detienen el entrenamiento y dejan completamente intactos los bots que de verdad alimentan las respuestas que ve el usuario.
-
8
Un rastreador importante solicitó news-sitemap.xml, sitemap.txt, sitemap.html y sitemap-index.xml, todos con 404, en un sitio cuyo robots.txt declara correctamente su sitemap. ¿Qué demuestra esto?
Algunos rastreadores adivinan por fuerza bruta los nombres de archivo del sitemap en lugar de leer la directiva Sitemap
El rastreador de Meta hace justo esto. Una línea Sitemap correcta en robots.txt no garantiza que un rastreador vaya a usarla.
-
9
Un visitante le hace una pregunta a ChatGPT, entra en tu sitio desde ahí y compra algo. ¿Por qué es posible que tu analítica nunca atribuya esa venta a ChatGPT?
Muchos clientes de IA no envían referrer, así que la visita se registra como directa
Los datos de referrer de los asistentes de IA son irregulares por diseño. Las aplicaciones de escritorio y móviles a menudo no pasan ninguna cabecera referer, los navegadores integrados se comportan de forma inconsistente y algunos clientes envían solo el dominio a secas. El tráfico acaba en directo, junto a los marcadores y las URL tecleadas. Las cifras del lado de la referencia son un suelo, no una medición.
-
10
En una semana típica, ¿cómo se compara el volumen de los rastreadores de IA con el de los rastreadores de búsqueda tradicionales?
La búsqueda sigue siendo unas 20 a 25 veces mayor
Google y Bing juntos hicieron muy por encima de cien mil peticiones en 72 horas; todos los rastreadores de IA verificados juntos hicieron unos pocos miles. El rastreo de IA está creciendo y es real, pero no ha desplazado al rastreo de búsqueda, y los titulares que sugieren lo contrario suelen estar contando user-agents falsificados.