AI Crawlers Also Reach You by Following Backlinks
Een hypothese uit de crawlerforensiek. Je serverlogs bevatten al een ruwe index van de externe pagina's die het meest waarschijnlijk voeden wat AI over je merk zegt. Je verzamelt de gegevens vrijwel zeker en gooit het signaal weg.
De meeste mensen stellen zich AI-crawlers voor zoals ze zich Googlebot voorstellen: die leest je sitemap, loopt je interne links af en indexeert je pagina's. Dat gebeurt. Maar het is niet de enige manier waarop GPTBot en de anderen je bereiken.
Ze komen ook binnen door een backlink te volgen: een forumdraad die je met een concurrent vergelijkt, een review op een site waar je nog nooit van hoorde, een overzichtsartikel dat naar je productpagina linkt. Wanneer een AI-crawler een van die links volgt, gebeurt dat bijna in realtime en belandt het met een tijdstempel in je access logs.
De gangbare manier om te achterhalen welke externe pagina's AI-antwoorden vormgeven, is ChatGPT, Perplexity en de rest te bevragen en de bronnen uit de JSON te schrapen die ze teruggeven. Dat werkt, en je zou het moeten doen. Maar het bekijkt het probleem van buitenaf, één prompt per keer. Je eigen logs laten je van binnenuit kijken, doorlopend, op gegevens die niemand aan een rate limit kan onderwerpen of kan afpakken.
Most Crawlers Will Not Tell You Where They Came From
Een gevolgde backlink is alleen nuttig als de crawler je vertelt welke pagina hij volgde, en dat staat op één plek: de Referer header die de crawler met zijn verzoek meestuurt.
Bijna geen enkele LLM-crawler stuurt die mee. Ze halen je pagina op en leggen niets vast over waar ze vandaan kwamen. Je ziet het bezoek. Je ziet de bron niet.
Dus het grootste deel van de crawl waar je om geeft is anoniem bij de bron. Je kunt bewijzen dat een AI-bot langskwam. Je kunt niet bewijzen wat hem stuurde. Eén crawler dicht dat gat.
PetalBot Is the Exception
PetalBot is de crawler achter Huawei's Petal Search. Het is niet de bot van een AI-lab. Maar hij doet één ding dat vrijwel niets anders doet: bij zijn verzoeken meldt hij de verwijzende URL. De exacte externe pagina die hij volgde om bij de jouwe te komen, inclusief querystring en al.
In onze logs is dat gedrag niet incidenteel. Het is de regel.
Eén PetalBot-logregel dicht het gat. Een normale AI-crawlerhit vertelt je dat een bot langskwam. Een PetalBot-hit vertelt je dat een bot langskwam en noemt de pagina die hem stuurde.
203.0.113.x - - [20/Jul/2026:14:22:07 +0000] "GET /products/widget-pro HTTP/1.1" 200 18244 "https://forum.example.com/thread/best-widgets-2026?sort=top" "PetalBot"
We rekenen PetalBot ook tot de beleefdere crawlers die we zien, gemeten naar piekverzoeken per minuut in onze logs. Hij ramt je origin niet plat. Er zijn weinig operationele kosten aan hem met rust laten, en een reële signaalkost aan hem blokkeren.
PetalBot and the LLM Crawlers Read the Same Web
De volgende stap is waar de methode ophoudt observatie te zijn en gevolgtrekking wordt.
PetalBot en de LLM-crawlers lezen grotendeels hetzelfde web. Ze volgen dezelfde links, vanaf dezelfde reviewsites en forums en vergelijkingsartikelen, want daar leven de vermeldingen van je merk. Dus wanneer PetalBot je een verwijzende URL aanreikt, wijst hij naar een pagina die de AI-crawlers aannemelijk ook lezen.
PetalBot meldt zijn verwijzer en de LLM-crawlers niet. Gebruik wat hij meldt als surrogaat voor wat zij achterhouden.
De techniek is triangulatie. Je kunt het doel niet rechtstreeks zien, dus meet je iets dat ermee meebeweegt. Hier is dat meetbare het verwijzingsspoor van PetalBot, dat in een logbestand zit dat je al bezit.
Build the Graph: From Raw Logs to a Citation Shortlist
Niets hiervan vraagt om een nieuwe tool. Het vraagt om de logs die je al verzamelt en een paar filterstappen.
Log aan de rand, en bewaar de Referer header
Leg verzoeken vast op de server of het CDN, niet in een JavaScript-tag, want crawlers voeren de tag niet uit. Het ene veld waar deze hele methode van afhangt is Referer. Als je logging die weglaat, of querystrings afkapt, los dat dan eerst op. Je kunt geen header terughalen die je nooit hebt opgeslagen.
Filter op PetalBot-hits die een externe verwijzer meedragen
Match de PetalBot-user-agent en houd dan alleen de hits over waarvan de verwijzer naar een domein wijst dat niet het jouwe is. Die externe verwijzers zijn je citation candidates. Laat zelfverwijzingen en lege verwijzers vallen; die zijn voor dit doel ruis.
Ontdubbel tot pagina's, rol dan op naar domeinen
Dezelfde forumdraad zal vele keren verschijnen. Vouw herhaalde URL's samen tot unieke pagina's, groepeer die pagina's dan onder hun domein. Nu heb je twee weergaven: de afzonderlijke pagina's die naar je linken, en de sites waar die pagina's op staan.
Weeg naar recentheid en herhaling
Een verwijzer die deze week vijftig keer is gezien overtreft er een die vorig kwartaal één keer werd gezien. Weeg elke kandidaat naar hoe vaak hij terugkeert en hoe recent hij voor het laatst is afgelopen. Recentheid is de belangrijke helft: een pagina die nu wordt gecrawld is een pagina die nu in omloop is.
Leg dit naast de LLM-crawlers op je eigen pagina's
Lijn de timing uit. Wanneer een PetalBot-verwijzing naar je productpagina wijst, controleer dan of GPTBot, ClaudeBot of de anderen diezelfde pagina in hetzelfde tijdvenster aandeden. Overlap in de timing versterkt de zaak dat de externe pagina deel uitmaakt van wat AI nu over je leest.
Rangschik het, en behandel het als een shortlist
Wat eruit komt is een gerangschikte lijst van externe pagina's en domeinen die het meest waarschijnlijk AI-antwoorden over je merk voeden, volledig opgebouwd uit first-party data. Behandel het als een lijst met leads om te onderzoeken, niet als een bewezen set citaties.
Stap 1 tot en met 6 zijn precies wat WISLR.ai voor je uitvoert. Het legt AI-crawler- en PetalBot-activiteit aan de rand vast, bewaart de verwijzers, en zet ze om in een gerangschikte, altijd actuele feed van de externe pagina's die het meest waarschijnlijk vormgeven wat AI over je merk zegt, afgezet tegen de LLM-crawlers die je eigen site aandoen. Geen loggeworstel vereist.
What the Graph Is Good For
Een gerangschikte feed van pagina's die over je praten, doorlopend ververst, is nuttig of de AI-grounding-hypothese nu klopt of niet.
Corrigeer misinformatie bij de bron. Als een pagina in je verwijzingsfeed iets verkeerds over je merk zegt, en zo vaak wordt gecrawld dat hij opduikt, dan weet je nu precies waar je moet reageren. Je raadt niet langer welke van duizend sites ertoe doet. De crawlers vertelden je welke er in omloop zijn.
Ontdek vermeldingen waarvan je het bestaan niet kende. De meeste merkmonitoring bewaakt een lijst die jij hebt opgesteld. Dit bewaakt een lijst die het web heeft opgesteld, en reikt je reviews, draden en vergelijkingspagina's aan die je nooit volgde, rechtstreeks uit je eigen access logs.
What We Are Assuming, and What We Cannot See
Onder deze methode liggen twee aannames, en geen van beide is bevestigd. Het is toch de moeite waard om te gebruiken, maar alleen als je weet waar het ophoudt.
We kunnen PetalBot's pad zien. Dat van OpenAI kunnen we niet zien. De overlap is een redelijke gok, want beide crawlen het open web waar merkvermeldingen leven, maar het is een gok. Sommige van PetalBot's verwijzers zullen pagina's zijn die geen enkele AI-crawler ooit leest, en sommige pagina's die AI leest zullen nooit in PetalBot's spoor opduiken.
Misschien. Misschien voedt het in plaats daarvan training. Misschien voedt het iets wat we niet hebben benoemd. De logdata kan ons niet vertellen welke, en wie je zegt dat het dat wel kan, gokt met meer stelligheid dan het bewijs toelaat. Wat de logs bewijzen is smal en reëel: een externe pagina linkte naar je, en een crawler volgde die.
Het is geen meting van AI-citaties. Het is een first-party proxy ervoor, goedkoop opgebouwd uit gegevens die je al verzamelt. We hebben precies dit voor klanten gebouwd: een first-party dataset van externe citation candidates, getrokken uit hun eigen logs. Wat speculatief is, is het label dat we op de graph plakken, niet de graph zelf.
We kunnen je feed van citation candidates bouwen uit je eigen logs.
WISLR leest AI-crawlergedrag aan de rand, per URL en per dag, op je first-party data. Dat omvat het trekken van PetalBot's verwijzingsspoor in een gerangschikte feed van de externe pagina's die het meest waarschijnlijk vormgeven wat AI over je merk zegt, afgezet tegen de LLM-crawlers die je site aandoen.