Skip to main content

Tus logs de servidor nombran las páginas de terceros que le enseñan a la IA sobre tu marca.

Cuando herramientas de IA como ChatGPT aprenden sobre tu marca, a menudo empiezan por otros sitios web que te mencionan: reseñas, hilos de foros, artículos comparativos. Cada vez que un crawler de IA sigue un enlace desde una de esas páginas hasta la tuya, tu servidor lo registra. El problema es que la mayoría de los crawlers de IA no dicen desde qué página llegaron. Un crawler, PetalBot, sí lo hace. Reporta la página externa exacta que te enlazó, cada vez. Eso te da una lista continua, construida a partir de registros que ya guardas, de las páginas que con mayor probabilidad moldean lo que la IA dice sobre tu marca. Esta guía explica cómo funciona, cómo construir la lista tú mismo y qué puede y qué no puede demostrar.

Forense de crawlers: PetalBot revela las páginas de terceros que con mayor probabilidad alimentan las citas de IA sobre tu marca
La hipótesis
  1. AI crawlers reach you by following backlinks, and that leaves a footprint. GPTBot and others do not only crawl your sitemap. They also arrive by following a link from a third-party page that mentions your brand: a forum thread, a comparison article, a review. That link-following happens in real time and lands in your server logs, timestamped and fresh.
  2. Most crawlers hide where they came from. PetalBot does not. Nearly every LLM crawler fetches your pages without saying which page sent it. PetalBot does the opposite: it reports the exact referring URL on its hits. That single behavior turns a log line into a source citation.
  3. PetalBot and the LLM crawlers largely read the same web. So when PetalBot hands you a referring URL, it is pointing at a page the AI crawlers are plausibly reading too. Pull those URLs and you have a first-party shortlist of the third-party pages most likely shaping what AI says about your brand.
  4. The overlap with AI crawlers is inferred, not confirmed. We can see PetalBot's path. We cannot see OpenAI's. Whether this data feeds citation grounding or model training is something the logs cannot tell us either. The method is useful anyway, and its limits are spelled out below.

Una hipótesis de forense de crawlers. Tus logs de servidor ya contienen un índice aproximado de las páginas de terceros que con mayor probabilidad alimentan lo que la IA dice sobre tu marca. Casi con certeza estás recopilando los datos y tirando la señal a la basura.

La mayoría imagina a los crawlers de IA como imagina a Googlebot: lee tu sitemap, recorre tus enlaces internos e indexa tus páginas. Eso ocurre. Pero no es la única forma en que GPTBot y los demás llegan a ti.

También llegan siguiendo un backlink: un hilo de foro que te compara con un competidor, una reseña en un sitio del que nunca has oído hablar, un artículo recopilatorio que enlaza a la página de tu producto. Cuando un crawler de IA sigue uno de esos enlaces, ocurre casi en tiempo real y aterriza en tus logs de acceso con una marca de tiempo.

Cada seguimiento de enlace registra un hecho sobre el que puedes actuar. Una página de terceros te mencionó, y un crawler recorrió el enlace para llegar a ti.

La forma habitual de averiguar qué páginas de terceros están moldeando las respuestas de la IA es preguntar a ChatGPT, Perplexity y los demás y extraer las fuentes del JSON que devuelven. Eso funciona, y deberías hacerlo. Pero mira el problema desde fuera, un prompt a la vez. Tus propios logs te dejan mirar desde dentro, de forma continua, sobre datos que nadie puede limitar por tasa ni quitarte.

Most Crawlers Will Not Tell You Where They Came From

El seguimiento de un backlink solo es útil si el crawler te dice qué página siguió, y eso vive en un solo lugar: la cabecera Referer que el crawler envía con su solicitud.

Casi ninguno de los crawlers de LLM la envía. Descargan tu página y no registran nada sobre de dónde vinieron. Ves la visita. No ves la fuente.

Crawler¿Reporta la página de referencia?
GPTBotNo reporta referencia
ClaudeBotNo reporta referencia
PerplexityBotNo reporta referencia
BingbotNo reporta referencia
PetalBotReporta la URL de referencia completa

Así que la mayor parte del rastreo que te importa es anónima en el origen. Puedes demostrar que un bot de IA visitó. No puedes demostrar qué lo envió. Un crawler cierra esa brecha.

PetalBot Is the Exception

PetalBot es el crawler detrás de Petal Search de Huawei. No es el bot de un laboratorio de IA. Pero hace algo que casi ningún otro hace: en sus solicitudes, reporta la URL de referencia. La página de terceros exacta que siguió para llegar a la tuya, con la cadena de consulta y todo.

En nuestros logs, ese comportamiento no es ocasional. Es la regla.

100%
de los accesos de PetalBot que examinamos llevaban la URL de origen completa
Cadenas de consulta conservadas
las referencias llegan intactas, no recortadas al dominio pelado

Una línea de log de PetalBot cierra la brecha. Un acceso normal de crawler de IA te dice que un bot llegó. Un acceso de PetalBot te dice que un bot llegó y nombra la página que lo envió.

Una única solicitud de PetalBot, anotada
203.0.113.x - - [20/Jul/2026:14:22:07 +0000] "GET /products/widget-pro HTTP/1.1" 200 18244 "https://forum.example.com/thread/best-widgets-2026?sort=top" "PetalBot"
La referenciaLa página de terceros que PetalBot siguió para llegar a ti. Este es el candidato a cita. La cadena de consulta se conserva, así que aterrizas en la vista exacta, no en una suposición.
La marca de tiempoCuándo se recorrió el enlace. Las referencias frescas importan más que las viejas: una página que se rastrea hoy es una página en circulación hoy.
El destinoA cuál de tus páginas enlazó el sitio de terceros. Eso te dice qué de tu marca se está discutiendo en otros sitios.

También situamos a PetalBot entre los crawlers más educados que vemos, medido por picos de solicitudes por minuto en nuestros logs. No está machacando tu origen. Hay poco coste operativo en dejarlo en paz, y un coste real de señal en bloquearlo.

No bloquees PetalBot. Bloquearlo es la única jugada que tira toda esta señal a la basura.

PetalBot and the LLM Crawlers Read the Same Web

El siguiente paso es donde el método deja de ser observación y se vuelve inferencia.

PetalBot y los crawlers de LLM están leyendo en gran medida la misma web. Siguen los mismos enlaces, desde los mismos sitios de reseñas, foros y artículos comparativos, porque ahí es donde viven las menciones de tu marca. Así que cuando PetalBot te entrega una URL de referencia, está apuntando a una página que los crawlers de IA plausiblemente también están leyendo.

PetalBot reporta su referencia y los crawlers de LLM no. Usa lo que reporta como sustituto de lo que ellos ocultan.

Página de terceros
Una reseña, hilo de foro o artículo comparativo que menciona tu marca y te enlaza.
PetalBot sigue el enlace
y registra la URL de referencia en tu log de acceso, con marca de tiempo y completa.
Los crawlers de LLM plausiblemente también lo siguen
leyendo la misma página por la misma razón. Este paso se infiere, no se observa.

La técnica es la triangulación. No puedes ver el objetivo directamente, así que mides algo que se mueve con él. Aquí, lo medible es el rastro de referencias de PetalBot, que está en un archivo de log que ya posees.

Build the Graph: From Raw Logs to a Citation Shortlist

Nada de esto necesita una herramienta nueva. Necesita los logs que ya recopilas y unos pocos pasos de filtrado.

1

Registra en el edge y conserva la cabecera Referer

Captura las solicitudes en el servidor o el CDN, no en una etiqueta de JavaScript, porque los crawlers no ejecutan la etiqueta. El único campo del que depende todo este método es Referer. Si tu registro lo elimina, o trunca las cadenas de consulta, arréglalo primero. No puedes recuperar una cabecera que nunca almacenaste.

2

Filtra a los accesos de PetalBot que llevan una referencia de terceros

Empareja el user-agent de PetalBot, luego conserva solo los accesos cuya referencia apunte a un dominio que no sea el tuyo. Esas referencias externas son tus candidatos a cita. Descarta las autorreferencias y las referencias vacías; son ruido para este propósito.

3

Deduplica a páginas, luego agrupa por dominios

El mismo hilo de foro aparecerá muchas veces. Colapsa las URL repetidas en páginas únicas, luego agrupa las páginas bajo su dominio. Ahora tienes dos vistas: las páginas individuales que te enlazan, y los sitios en los que viven esas páginas.

4

Pondera por recencia y recurrencia

Una referencia vista cincuenta veces esta semana supera a una vista una vez el trimestre pasado. Pondera cada candidato según con qué frecuencia se repite y qué tan reciente fue la última vez que se recorrió. La recencia es la mitad importante: una página que se rastrea ahora es una página en circulación ahora.

5

Cruza con los crawlers de LLM en tus propias páginas

Alinea los tiempos. Cuando una referencia de PetalBot apunta a la página de tu producto, comprueba si GPTBot, ClaudeBot o los demás accedieron a esa misma página en la misma ventana. La coincidencia en los tiempos refuerza la tesis de que la página de terceros forma parte de lo que la IA está leyendo actualmente sobre ti.

6

Ordénalo y trátalo como una lista corta

Lo que sale es una lista ordenada de páginas y dominios de terceros que con mayor probabilidad alimentan las respuestas de la IA sobre tu marca, construida enteramente a partir de datos propios. Trátala como una lista de pistas para investigar, no como un conjunto de citas demostrado.

O sáltate la cadena de procesamiento

Los pasos 1 al 6 son exactamente lo que WISLR.ai ejecuta por ti. Captura la actividad de los crawlers de IA y de PetalBot en el edge, conserva las referencias, y las convierte en un flujo ordenado y siempre actualizado de las páginas de terceros que con mayor probabilidad moldean lo que la IA dice sobre tu marca, cruzado con los crawlers de LLM que acceden a tu propio sitio. Sin necesidad de lidiar con logs.

Build it with WISLR.ai →

What the Graph Is Good For

Un flujo ordenado de páginas que hablan de ti, actualizado de forma continua, es útil se sostenga o no la hipótesis de la fundamentación de la IA.

Corrige la desinformación en la fuente. Si una página de tu flujo de referencias está diciendo algo incorrecto sobre tu marca, y se rastrea con suficiente frecuencia como para aparecer, ahora sabes exactamente dónde responder. Ya no estás adivinando cuál de mil sitios importa. Los crawlers te dijeron cuáles están en circulación.

Descubre menciones que no sabías que existían. La mayoría de la monitorización de marca vigila una lista que tú construiste. Esta vigila una lista que construyó la web, y te entrega reseñas, hilos y páginas comparativas que nunca estabas rastreando, directamente desde tus propios logs de acceso.

Si la hipótesis de la fundamentación de la IA nunca se sostiene, todavía tienes un flujo de monitorización de marca construido a partir de datos que ya recopilas. Si sí se sostiene, tienes un mapa de dónde está aprendiendo la IA sobre ti.

What We Are Assuming, and What We Cannot See

Bajo este método hay dos supuestos, y ninguno está confirmado. Vale la pena usarlo de todos modos, pero solo si sabes dónde se detiene.

Suponemos que PetalBot y los crawlers de LLM siguen los mismos enlaces.

Podemos ver el camino de PetalBot. No podemos ver el de OpenAI. La coincidencia es una apuesta razonable, porque ambos rastrean la web abierta donde viven las menciones de marca, pero es una apuesta. Algunas de las referencias de PetalBot serán páginas que ningún crawler de IA lee nunca, y algunas páginas que la IA lee nunca aparecerán en el rastro de PetalBot.

Suponemos que estos datos se usarían para la fundamentación de citas.

Podría ser. Podría alimentar el entrenamiento en su lugar. Podría alimentar algo que no hemos nombrado. Los datos del log no pueden decirnos cuál, y quien te diga que sí puede está adivinando con más confianza de la que la evidencia permite. Lo que los logs demuestran es estrecho y real: una página de terceros te enlazó, y un crawler la siguió.

No es una medición de las citas de IA. Es un indicador propio de ellas, construido de forma barata a partir de datos que ya recopilas. Hemos construido exactamente esto para clientes: un conjunto de datos propios de candidatos a cita de terceros, extraído de sus propios logs. Lo que es especulativo es la etiqueta que le ponemos al grafo, no el grafo en sí.

Trabaja con WISLR

Podemos construir tu flujo de candidatos a cita a partir de tus propios logs.

WISLR lee el comportamiento de los crawlers de IA en el edge, por URL y por día, sobre tus datos propios. Eso incluye extraer el rastro de referencias de PetalBot hacia un flujo ordenado de las páginas de terceros que con mayor probabilidad moldean lo que la IA dice sobre tu marca, y cruzarlo con los crawlers de LLM que acceden a tu sitio.

See how AI Channel Analytics measures it →