Skip to main content
Carl, host of the WISLR crawl quiz

Week van 3 augustus 2026

Wie houden deze bots voor de gek?

Het meeste van wat er over AI-crawlers geschreven wordt, komt uit aankondigingen van leveranciers en niet uit logs. Deze vragen komen uit beide bronnen: echte edge logs van een middelgrote e-commercesite, en de crawlerdocumentatie die de AI-bedrijven zelf publiceren. Beantwoord een vraag en het bewijs verschijnt meteen.

Vragen
10
Minuten
6
  1. 1

    Welke bot heeft afgelopen week /sitemap.xml het vaakst opgevraagd?

    Bingbot van Microsoft

    Bingbot haalde het bestand tientallen keren op. De echte GPTBot, ClaudeBot, PerplexityBot en Gemini-crawlers haalden het nul keer op, terwijl ze duizenden verzoeken naar dezelfde site stuurden. AI-crawlers ontdekken content vrijwel altijd door links te volgen, niet door sitemaps te lezen. Een sitemap indienen is een zoekmachineritueel; voor AI-zichtbaarheid doet het, voor zover wij weten, bijzonder weinig.

  2. 2

    Wat is Google-Extended?

    Een robots.txt-token dat bepaalt of gecrawlde content Gemini traint en antwoorden van Gemini onderbouwt

    Het doet zelf nooit een verzoek. Google geeft aan dat Google-Extended geen eigen aparte user agent heeft, dus het crawlen verloopt nog steeds via de gewone Google-crawlers en het token bepaalt alleen wat er daarna met die content gebeurt: het trainen van toekomstige Gemini-modellen en het onderbouwen van antwoorden in Gemini Apps en Vertex AI. Google zegt er ook uitdrukkelijk bij dat het geen invloed heeft op de opname van een site in Google Search en geen rankingsignaal is, dus blokkeren kost je niets in Search en levert geen enkel verzoek minder crawlverkeer op.

  3. 3

    Wat is de enige betrouwbare manier om te bevestigen dat een verzoek echt van GPTBot kwam?

    Reverse DNS in combinatie met de gepubliceerde IP-ranges van de leverancier

    User-agent-strings zijn vrije tekst. Iedereen kan er willekeurig een meesturen, en veel scanners doen dat ook.

  4. 4

    Welke activiteit van OpenAI zorgt bij een doorsnee uitgever voor de meeste verzoeken?

    ChatGPT-User die een pagina ophaalt omdat een mens ernaar vroeg

    Door gebruikers gestarte ophaalacties overtroffen de trainingscrawls met ongeveer zes tegen een. Het meeste AI-botverkeer is geen training, het is de vraag van een echt persoon die op dat moment wordt beantwoord.

  5. 5

    Je logs tonen verkeer met een OpenAI-label vanaf een Google Cloud-IP. Wat is de meest waarschijnlijke verklaring?

    Een vervalste user-agent

    Wij hebben precies dit betrapt: één scanner op één enkel Google Cloud-netwerk stuurde in 72 uur ruim duizend verzoeken en wisselde daarbij af tussen user-agents van OpenAI, Perplexity en Gemini, met één URL per pad. Dat is enumeratie, geen crawlen. Echte OpenAI-crawlers gaan naar buiten via Azure.

  6. 6

    Wat beschrijft het beste hoe de grote AI-bedrijven het web crawlen?

    Elk bedrijf zet meerdere afzonderlijke bots in, elk met een eigen taak

    De eigen documentatie van OpenAI noemt er vier: GPTBot voor trainingsdata, ChatGPT-User voor een live ophaalactie wanneer een mens iets vraagt, OAI-SearchBot voor de zoekresultaten van ChatGPT en OAI-AdsBot voor het controleren van pagina's die als advertentie worden aangeleverd. Anthropic en de anderen volgen hetzelfde patroon. OpenAI geeft aan dat elke instelling losstaat van de andere, dus een uitgever kan OAI-SearchBot toelaten om in de zoekresultaten te verschijnen en tegelijk GPTBot weigeren. Daarmee is "moet ik AI-bots toelaten?" niet één beslissing, maar vier.

  7. 7

    Je voegt User-agent: GPTBot met Disallow: / toe aan robots.txt. Wat bereikt je site dan nog steeds?

    ChatGPT-User en OAI-SearchBot

    Eén token blokkeren blokkeert één bot. OpenAI geeft aan dat elke instelling losstaat van de andere, dus de zoekcrawler, de advertentiecrawler en de live ophaalactie voor gebruikers gaan gewoon door. ChatGPT-User is het lastige geval: omdat die verzoeken door een persoon worden gestart en niet door een crawlschema, merkt OpenAI op dat robots.txt-regels er mogelijk helemaal niet op van toepassing zijn. De meeste configuraties in de trant van "wij hebben AI geblokkeerd" stoppen het trainen en laten juist de bots die de voor gebruikers zichtbare antwoorden aandrijven volledig ongemoeid.

  8. 8

    Een grote crawler vroeg news-sitemap.xml, sitemap.txt, sitemap.html en sitemap-index.xml op, allemaal 404, op een site waarvan robots.txt de sitemap correct opgeeft. Wat laat dit zien?

    Sommige crawlers raden sitemapbestandsnamen met brute force in plaats van de Sitemap-directive te lezen

    De crawler van Meta doet dit. Een correcte Sitemap-regel in robots.txt is geen garantie dat een crawler die ook gebruikt.

  9. 9

    Een bezoeker stelt ChatGPT een vraag, klikt door naar je site en koopt iets. Waarom schrijft je analytics dat mogelijk nooit toe aan ChatGPT?

    Veel AI-clients sturen geen referrer mee, waardoor het bezoek als direct wordt geregistreerd

    Referrergegevens van AI-assistenten zijn van nature onvolledig. Desktop- en mobiele apps sturen vaak helemaal geen referer-header mee, in-app browsers gedragen zich inconsistent en sommige clients sturen alleen een kaal domein mee. Dat verkeer belandt bij direct, samen met bookmarks en handmatig ingetypte URL's. Cijfers aan de verwijzingskant zijn een ondergrens, geen meting.

  10. 10

    Hoe verhoudt het volume van AI-crawlers zich in een doorsnee week tot dat van traditionele zoekmachinecrawlers?

    Zoeken is nog steeds ongeveer 20 tot 25 keer groter

    Google en Bing deden samen ruim honderdduizend verzoeken in drie dagen; alle geverifieerde AI-crawlers bij elkaar kwamen op een paar duizend. AI-crawlen groeit en is reëel, maar het heeft het crawlen voor zoekmachines niet verdrongen, en koppen die iets anders suggereren tellen meestal vervalste user-agents mee.