Skip to main content
Carl, host of the WISLR crawl quiz

Semaine du 3 août 2026

Qui ces bots croient-ils tromper ?

L'essentiel de ce qui s'écrit sur les crawlers IA vient des annonces des éditeurs plutôt que des logs. Ces questions viennent des deux : de vrais logs edge d'un site e-commerce de taille moyenne, et la documentation que les entreprises d'IA publient elles-mêmes sur leurs crawlers. Répondez à chaque question et la preuve s'affiche aussitôt.

Questions
10
Minutes
6
  1. 1

    Au cours de la semaine écoulée, quel bot a demandé /sitemap.xml le plus souvent ?

    Bingbot de Microsoft

    Bingbot l'a récupéré des dizaines de fois. Les vrais crawlers GPTBot, ClaudeBot, PerplexityBot et Gemini ne l'ont récupéré aucune fois, alors qu'ils envoyaient des milliers de requêtes au même site. Les crawlers IA découvrent massivement le contenu en suivant des liens, pas en lisant des sitemaps. Soumettre un sitemap est un rituel de moteur de recherche : cela n'apporte pas grand-chose à la visibilité IA, pour autant que nous le sachions.

  2. 2

    Qu'est-ce que Google-Extended ?

    Un jeton robots.txt qui contrôle si le contenu crawlé sert à entraîner Gemini et à ancrer ses réponses

    Il n'envoie jamais la moindre requête. Google indique que Google-Extended ne dispose pas de son propre user-agent distinct, le crawl passe donc toujours par les crawlers Google habituels, et le jeton ne régit que ce qu'il advient de ce contenu ensuite : l'entraînement des futurs modèles Gemini et l'ancrage des réponses dans Gemini Apps et Vertex AI. Google précise aussi qu'il n'affecte pas la présence d'un site dans Google Search et qu'il ne constitue pas un signal de classement, le bloquer ne coûte donc rien dans Search et ne réduira pas votre trafic de crawl d'une seule requête.

  3. 3

    Quel est le seul moyen fiable de confirmer qu'une requête provient réellement de GPTBot ?

    Le DNS inverse associé aux plages d'IP publiées par l'éditeur

    Les chaînes user-agent sont du texte libre. N'importe qui peut envoyer n'importe laquelle, et bon nombre de scanners ne s'en privent pas.

  4. 4

    Chez un éditeur type, quelle activité d'OpenAI génère le plus de requêtes ?

    ChatGPT-User qui récupère une page parce qu'un humain a posé une question à son sujet

    Les récupérations initiées par un utilisateur ont dépassé les crawls d'entraînement dans un rapport d'environ six pour un. L'essentiel du trafic des bots IA n'est pas de l'entraînement, c'est la question d'une vraie personne à laquelle on répond en temps réel.

  5. 5

    Vos logs montrent du trafic étiqueté OpenAI provenant d'une IP Google Cloud. Quelle est l'explication la plus probable ?

    Un user-agent usurpé

    Nous avons observé exactement ce cas : un scanner installé sur un seul réseau Google Cloud a envoyé bien plus de mille requêtes en trois jours, en alternant les user-agents OpenAI, Perplexity et Gemini, et en touchant une seule URL par chemin. C'est de l'énumération, pas du crawl. Les vrais crawlers d'OpenAI sortent depuis Azure.

  6. 6

    Qu'est-ce qui décrit le mieux la façon dont les grandes entreprises d'IA crawlent le web ?

    Chaque entreprise exploite plusieurs bots distincts, avec des rôles différents

    La documentation d'OpenAI en liste quatre : GPTBot pour les données d'entraînement, ChatGPT-User pour une récupération en direct quand un humain pose une question, OAI-SearchBot pour les résultats de recherche de ChatGPT, et OAI-AdsBot pour vérifier les pages soumises comme annonces. Anthropic et les autres suivent le même schéma. OpenAI précise que chaque réglage est indépendant : un éditeur peut donc autoriser OAI-SearchBot pour apparaître dans la recherche tout en interdisant GPTBot. Autrement dit, « faut-il autoriser les bots IA ? » n'est pas une décision, c'en est quatre.

  7. 7

    Vous ajoutez User-agent: GPTBot avec Disallow: / dans votre robots.txt. Qu'est-ce qui atteint encore votre site ?

    ChatGPT-User et OAI-SearchBot

    Bloquer un jeton bloque un bot. OpenAI précise que chaque réglage est indépendant : le crawler de recherche, le crawler publicitaire et la récupération en direct déclenchée par l'utilisateur continuent donc tous. ChatGPT-User est le cas délicat : comme ces requêtes sont initiées par une personne et non par un calendrier de crawl, OpenAI note que les règles de robots.txt peuvent ne pas s'y appliquer du tout. La plupart des configurations « nous avons bloqué l'IA » arrêtent l'entraînement et laissent parfaitement intacts les bots qui alimentent réellement les réponses vues par les utilisateurs.

  8. 8

    Un crawler majeur a demandé news-sitemap.xml, sitemap.txt, sitemap.html et sitemap-index.xml, tous en 404, sur un site dont le robots.txt déclare correctement son sitemap. Qu'est-ce que cela montre ?

    Certains crawlers devinent les noms de fichiers de sitemap par force brute au lieu de lire la directive Sitemap

    Le crawler de Meta fait exactement cela. Une ligne Sitemap correcte dans robots.txt ne garantit en rien qu'un crawler l'utilisera.

  9. 9

    Un visiteur pose une question à ChatGPT, clique vers votre site et achète quelque chose. Pourquoi votre outil d'analytics risque-t-il de ne jamais créditer ChatGPT ?

    Beaucoup de clients IA n'envoient aucun référent, la visite est donc enregistrée comme directe

    Les données de référent des assistants IA sont lacunaires par conception. Les applications de bureau et mobiles ne transmettent souvent aucun en-tête referer, les navigateurs intégrés se comportent de façon incohérente, et certains clients n'envoient qu'un simple nom de domaine. Le trafic atterrit dans le direct, aux côtés des favoris et des URL saisies à la main. Les chiffres côté referral sont un plancher, pas une mesure.

  10. 10

    Sur une semaine type, comment le volume des crawlers IA se compare-t-il à celui des crawlers de recherche traditionnels ?

    La recherche reste environ 20 à 25 fois plus importante

    Google et Bing ont totalisé bien plus de cent mille requêtes en trois jours, tandis que l'ensemble des crawlers IA vérifiés en a fait quelques milliers. Le crawl IA progresse et il est bien réel, mais il n'a pas supplanté le crawl de recherche, et les titres qui laissent entendre le contraire comptent en général des user-agents usurpés.