Why We Re-Tested Our Own Insights
मार्च 2026 में हमने AI बॉट व्यवहार पर बीस निष्कर्ष प्रकाशित किए थे, जो एक ही प्रॉपर्टी के 48 दिनों के सर्वर लॉग से निकले थे। एक लंबी, बाद की विंडो ने उनके साथ यह किया।
बॉट रिसर्च जल्दी पुरानी पड़ती है, और ज़्यादातर की कभी जाँच ही नहीं होती। हम जानना चाहते थे कि कितनी जल्दी, इसलिए हमने मूल सूची को तीन प्रॉपर्टीज पर छह महीने के लॉग के मुकाबले दोबारा चलाया और हर इनसाइट के लिए एक फैसला दर्ज किया। सत्रह को दोबारा जाँचा जा सका। उनमें से ग्यारह पाँच महीनों के भीतर हिल चुकी थीं।
मूल लेख अब भी ठीक वैसा ही प्रकाशित है: AI बॉट ट्रैफिक तेज़ी से बढ़ रहा है, 48-दिन का अध्ययन। वहाँ चुपचाप कुछ भी संपादित नहीं किया गया। यह लेख उसका ऑडिट है।
The 20 Takeaways, Re-Tested Six Months Later
पीछे छूटी और बदली हुई इनसाइट मिलकर करीब पाँच महीनों में 17 में से 11 इनसाइट बनती हैं, यानी सूची का 65%। हर फैसला बताता है कि क्रॉलर आबादी ने आगे क्या किया, न कि मूल माप में कोई खामी। फैसले एक बाद की, लंबी विंडो से आए हैं: 1 फरवरी से 13 जुलाई 2026 के बीच तीन प्रॉपर्टीज पर 154,864 वर्गीकृत रिक्वेस्ट, जिन्हें एक बड़ी ईकॉमर्स प्रॉपर्टी से क्रॉस-रेफरेंस किया गया।
- 01बदली
आपकी sitemap.xml अभी ज़्यादा अहम हो गई है। GPTBot और ClaudeBot दोनों ने मार्च 2026 में sitemap की खपत को ऊँचे स्तर पर पहुँचाया और फिर पीछे नहीं देखा। अगर आपका sitemap पुराना, अधूरा या भाषा वेरिएंट के बिना है, तो AI क्रॉलर कंटेंट चूक जाएँगे।
छह महीने बाद 20/07/26 तकsitemap की खपत फिर चढ़ी और वहीं टिकी रही। ClaudeBot अब बड़े अंतर से सबसे बड़ा उपभोक्ता है, करीब Googlebot से 6x, और दोनों बॉट फरवरी में ही sitemap फेच कर रहे थे, इसलिए मार्च शुरुआत नहीं बल्कि एस्केलेशन था।
- 02कायम
robots.txt का सार्वभौमिक पालन नहीं होता। GPTBot और Meta-WebIndexer इसे कभी नहीं जाँचते। अगर आपकी AI कंटेंट रणनीति robots.txt निर्देशों पर टिकी है, तो जान लें कि दो सबसे सक्रिय क्रॉलर उन्हें पूरी तरह अनदेखा करते हैं।
छह महीने बाद 20/07/26 तकGPTBot ने 6,872 कंटेंट रिक्वेस्ट के मुकाबले robots.txt की 2 रिक्वेस्ट कीं। Meta ने 3,169 में से शून्य कीं। दोनों पर पुष्टि हुई।
- 03पीछे छूटी
ChatGPT-User ट्रैफिक AI बातचीत में ब्रांड उद्धरण का सीधा संकेत है। हर रिक्वेस्ट एक असली व्यक्ति को दर्शाती है जो आपका URL ChatGPT में पेस्ट कर रहा है। यह मापने लायक माउथ-टू-माउथ प्रचार है, और यह तेज़ी से बढ़ रहा है।
छह महीने बाद 20/07/26 तकपाँच महीनों में 11% ऊपर, बीच में एक गिरावट के साथ: फरवरी में 3,827 के मुकाबले जून में 4,236। संकेत असली है, और जिस विंडो को हमने मापा था उसके बाद वृद्धि सपाट हो गई।
- 04कायम
AI बॉट बर्स्ट में क्रॉल करते हैं, लगातार धारा में नहीं। GPTBot ने 3 मिनट की विंडो में 114 req/min छुए। अगर आपका सर्वर बर्स्ट ट्रैफिक नहीं झेल सकता, तो इंडेक्सिंग रन के दौरान AI क्रॉलर थ्रॉटल हो सकते हैं या एरर पा सकते हैं।
छह महीने बाद 20/07/26 तकपुष्ट और और तीव्र। पीक अब 270 रिक्वेस्ट प्रति मिनट है, और चार बॉट 130 से ऊपर हैं।
- 05कायम
OpenAI और Anthropic, दोनों 3-3 अलग बॉट चलाते हैं। एक ट्रेनिंग/इंडेक्सिंग के लिए, एक सर्च के लिए, एक लाइव यूज़र सेशन के लिए। एक को ब्लॉक करने से बाकी ब्लॉक नहीं होते। आपकी robots.txt में हर एक के लिए अलग निर्देश चाहिए।
छह महीने बाद 20/07/26 तकयह ऊपरी नहीं, निचली सीमा है। OpenAI अब कम से कम चार चलाता है, जिनमें एक विज्ञापन क्रॉलर भी है जो अपनी IP रेंज सूची प्रकाशित करता है। तीन-तीन एक फर्श है, गिनती नहीं।
- 06पीछे छूटी
OAI-SearchBot और Googlebot ही ऐसे बॉट हैं जो बड़ी मात्रा में इमेज फेच करते हैं। अगर आपके लेख की इमेज में असल कंटेंट है (चार्ट, डायग्राम, डेटा विज़ुअलाइज़ेशन), तो यही बॉट उन्हें सर्च रिज़ल्ट में इस्तेमाल करेंगे।
छह महीने बाद 20/07/26 तकअब छह बॉट Googlebot से ज़्यादा इमेज शेयर फेच करते हैं। यहाँ नामित दोनों 7वें और 10वें स्थान पर हैं। इमेज फेचिंग अब पूरी क्रॉलर आबादी में आम है।
- 07बदली
ChatGPT-User सिर्फ टेक्स्ट निकालता है। शून्य इमेज, शून्य CSS, शून्य JS। आपका HTML कंटेंट ही AI बातचीत में खिंचता है। AI विजिबिलिटी के लिए संरचित, साफ टेक्स्ट विज़ुअल डिज़ाइन से ज़्यादा मायने रखता है।
छह महीने बाद 20/07/26 तकलगभग वैसा ही, पर अब शून्य नहीं: 95.3% पेज के मुकाबले 1.9% इमेज। इसका CSS और JavaScript वाला हिस्सा जाँचा नहीं जा सकता, क्योंकि लॉग पाइपलाइन उन फाइलों को स्टोर करने से पहले हटा देती है।
- 08बदली
AI क्रॉलर अलग-अलग घंटों में पीक करते हैं। GPTBot 04:00 UTC पर आता है। Claude-SearchBot रात भर पीक करता है। PerplexityBot 23:00, 05:00 और 09:00 पर बर्स्ट करता है। अगर आप साइट में बदलाव US के ऑफ-पीक घंटों में तैनात करते हैं, तो उन्हें सबसे पहले AI बॉट देख सकते हैं।
छह महीने बाद 20/07/26 तकपैटर्न कायम है और हर विशिष्ट घंटा हिल चुका है। GPTBot अब 17:00 UTC पर पीक करता है, और यह हमारा मापा हुआ सबसे समय-केंद्रित क्रॉलर है, जिसकी पूरी वॉल्यूम का 21.4% उसी एक घंटे में आता है।
- 09बदली
वॉल्यूम के लिहाज़ से Meta सबसे आक्रामक AI क्रॉलर है। इस डेटासेट में Meta-WebIndexer ने किसी भी दूसरे बॉट से ज़्यादा रिक्वेस्ट भेजीं, और robots.txt की एक भी जाँच नहीं की। अगर आप Meta के क्रॉलर ट्रैक नहीं कर रहे, तो आप सबसे बड़े खिलाड़ी को चूक रहे हैं।
छह महीने बाद 20/07/26 तकलिखते समय यह डेटा से आगे निकल गई थी और अब डेटा इसके बराबर आ रहा है। पूरे छह महीनों में Meta 12वें स्थान पर है। जुलाई में यह प्रॉपर्टी का अकेला सबसे भारी AI क्रॉलर है, जबकि मई तक यह पूरी तरह गैरमौजूद था।
- 10पीछे छूटी
llms.txt को अपनाना अब भी सैद्धांतिक है। 48 दिनों में किसी AI बॉट ने /llms.txt की माँग नहीं की। यह आगे चलकर मानक बन सकती है, पर फिलहाल कोई क्रॉलर इसे नहीं खोजता।
छह महीने बाद 20/07/26 तकतब से यह लगातार फेच होने लगी है, लेकिन ज़्यादातर स्कैनर, ऑडिटर और रिसर्च प्रोब द्वारा, फ्रंटियर लैब्स द्वारा नहीं। CCBot, ClaudeBot और Googlebot इसे फेच करते हैं। GPTBot नहीं करता।
- 11बदली
Applebot आपके पेज पूरी तरह रेंडर करता है। यह CSS, JS और इमेज फेच करता है (इसके ट्रैफिक का 47%)। अगर आपके कंटेंट को पूरा होने के लिए JavaScript रेंडरिंग चाहिए, तो Applebot उसे देखेगा, पर ज़्यादातर AI बॉट नहीं देखेंगे।
छह महीने बाद 20/07/26 तकदिशा सही, पर स्तर अब काफी नीचे: Applebot के ट्रैफिक में इमेज 27.6% हैं, तब के 47% के मुकाबले। CSS और JavaScript वाला हिस्सा यहाँ उसी पाइपलाइन वजह से जाँचा नहीं जा सकता जो ऊपर इनसाइट 9 में बताई गई है।
- 12कायम
तकनीकी, हाउ-टू कंटेंट का AI बातचीत में सबसे ज़्यादा हवाला दिया जाता है। शीर्ष ChatGPT-User पेज सभी इंप्लीमेंटेशन गाइड और तकनीकी व्याख्या थे। गहरा, विशिष्ट कंटेंट AI उद्धरण कमाता है।
छह महीने बाद 20/07/26 तकमूल सूची का सबसे मज़बूत निष्कर्ष। सभी बारह शीर्ष गंतव्य इंप्लीमेंटेशन गाइड, टूल तुलना या तकनीकी विश्लेषण हैं। कुछ भी सामान्य नहीं, कुछ भी प्रचारात्मक नहीं। एक अकेली माइग्रेशन गाइड ने नेटवर्क के कुल ChatGPT-User ट्रैफिक का 34% खींचा।
- 13पीछे छूटी
Bytespider और CCBot सिर्फ robots.txt जाँचते हैं और कभी क्रॉल नहीं करते। वे आपके robots.txt निर्देश पढ़ते हैं पर उन पर आगे कुछ नहीं करते। यह बदल सकता है, पर फिलहाल वे शून्य कंटेंट इंडेक्सिंग के साथ अनुपालन का बोझ पैदा करते हैं।
छह महीने बाद 20/07/26 तकहमारे मापने के बाद यह पलट गया। Bytespider अब प्रॉपर्टी का तीसरा सबसे भारी क्रॉलर है, और उसकी 16,810 रिक्वेस्ट में से 94% अनुपालन नहीं, कंटेंट हैं।
- 14कायम
AI क्रॉल वॉल्यूम रातोंरात बदल सकता है। GPTBot एक ही हफ्ते में 0 से 187 रिक्वेस्ट पर पहुँचा। आपके क्रॉल बजट अनुमानों को क्रमिक वृद्धि नहीं, अचानक छलाँगों को ध्यान में रखना होगा।
छह महीने बाद 20/07/26 तकपुष्ट, और मूल रूप से दिए गए उदाहरण से साफ उदाहरण के साथ। Meta करीब आठ हफ्तों में शून्य से 2,615 रिक्वेस्ट प्रति महीने पर पहुँचा।
- 15पीछे छूटी
IP विश्लेषण बॉट की पहचान उजागर करता है। ChatGPT-User का लगभग 1:1 IP-से-रिक्वेस्ट अनुपात व्यक्तिगत यूज़र सेशन साबित करता है। GPTBot के 2 IP केंद्रीकृत इंफ्रास्ट्रक्चर साबित करते हैं। IP पैटर्न असली यूज़र-ट्रिगर्ड फेच को स्वचालित क्रॉलिंग से अलग करने में मदद करते हैं।
छह महीने बाद 20/07/26 तकतरीका टिका रहा और उसमें मौजूद हर आँकड़ा हिल गया। ChatGPT-User अब 1,588 पतों पर 12.4 रिक्वेस्ट प्रति IP चलाता है। GPTBot 129 IP चलाता है, 2 नहीं। यहाँ वर्णित लगभग 1:1 फिंगरप्रिंट अब 1.4 पर Claude-User का है।
- 16कायम
समन्वित क्रॉल इवेंट बॉट परिवारों में होते हैं। GPTBot और OAI-SearchBot 19 मार्च को एक ही Microsoft इंफ्रास्ट्रक्चर से एक साथ चले। जब एक OpenAI बॉट तेज़ होता है, तो बाकी के भी पीछे आने की उम्मीद रखें।
छह महीने बाद 20/07/26 तकबताई गई ठीक उसी तारीख पर स्वतंत्र रूप से पुष्ट, छह महीनों में सिर्फ उन दो दिनों में से एक जब दोनों बॉट उन स्तरों को एक साथ पार कर गए।
- 17पीछे छूटी
जिन बॉट के नाम आपने कभी नहीं सुने, वे पहले से आ रहे हैं। PromptingBot, LinkupBot, Brightbot, Observer और दूसरे सक्रिय रूप से कंटेंट क्रॉल कर रहे हैं। AI बॉट का परिदृश्य जाने-माने नामों से कहीं बड़ा है।
छह महीने बाद 20/07/26 तकनामित चारों बॉट ने नए छह महीनों में शून्य रिक्वेस्ट कीं। मूल बात पूरी तरह अलग कलाकारों के साथ टिकी रहती है: लंबी पूँछ पर अब llms.txt स्कैनर और AI-रेडीनेस ऑडिटर हावी हैं। किसी भी नामित सूची की उम्र कुछ महीने ही होती है।
This data is representative of wislr.com only and should not be read as an overall industry trend. Our intent is to spark conversation, share data, and encourage brands to inspect this for themselves.
What Six Months of Logs Changed
मूल अध्ययन एक ही प्रॉपर्टी पर 48 दिन चला था। यह दोबारा जाँच 1 फरवरी से 13 जुलाई 2026 के बीच तीन प्रॉपर्टीज पर 154,864 वर्गीकृत रिक्वेस्ट को कवर करती है, जिन्हें 7.26 मिलियन रिक्वेस्ट वाली एक बड़ी ईकॉमर्स प्रॉपर्टी से क्रॉस-रेफरेंस किया गया, और बॉट पहचान 75-पैटर्न वाली रेफरेंस टेबल के मुकाबले user-agent से तय की गई।
मूल 48-दिन का अध्ययन एक साइट पर था और उसने यह कहा भी था। यह दोबारा जाँच हमारी चलाई तीन प्रॉपर्टीज पर फैली है, जिन्हें Site A, Site B और Site C कहा गया है, साथ में एक बड़ी तुलना प्रॉपर्टी भी है। हम इन लेबल को डोमेन से नहीं जोड़ते, इसलिए छह महीने के आँकड़े बिना श्रेय के दर्ज हैं।
जिन सत्रह इनसाइट को हम दोबारा जाँच सके, उनमें से ग्यारह पाँच महीनों के भीतर हिल गईं, छह को नए क्रॉलर व्यवहार ने पीछे छोड़ा और पाँच में उल्लेखनीय बदलाव आया। यह दर ही निष्कर्ष है। इसके नीचे का पैटर्न किसी एक सुधार से ज़्यादा मायने रखता है: व्यवहार टिके रहे और आँकड़े हिल गए। बर्स्ट, समन्वित वेंडर इवेंट, तकनीकी कंटेंट की ओर झुकाव, सब अब भी मौजूद हैं। हमने जो भी विशिष्ट बॉट नाम, अनुपात और पीक आवर प्रकाशित किया था, वह बदल चुका है।
Meta went from absent to first in eight weeks
डेटासेट का सबसे बड़ा बदलाव। meta-externalagent ने मई तक कुछ भी दर्ज नहीं किया, उस महीने एक अकेली रिक्वेस्ट, फिर जून में 553 और जुलाई के पहले तेरह दिनों में 2,615। यह अब प्रॉपर्टी का सबसे भारी AI क्रॉलर है, और जुलाई अधूरा महीना है, इसलिए वह आँकड़ा इसे कम करके दिखाता है।
पूरे छह महीनों में Meta बारहवें स्थान पर है। जुलाई में यह पहले स्थान पर है। दोनों बातें सही हैं, और यही वजह है कि क्रॉल बजट का फैसला किसी एक विंडो की रैंकिंग पर टिकाना ठीक नहीं। इसने 3,169 हिट में robots.txt की शून्य रिक्वेस्ट भी कीं।
The bot rankings churn, the behaviours do not
चौदह बॉट, जिनका वॉल्यूम महीने दर महीने ट्रैक करने लायक है। देखिए कि फरवरी से जुलाई तक इस आबादी की शक्ल खुद से कितनी कम मिलती है।
The IP fingerprint inverted
मूल पाठ में यूज़र-ट्रिगर्ड फेच को केंद्रीकृत क्रॉलिंग से अलग करने के लिए रिक्वेस्ट प्रति IP का इस्तेमाल हुआ था। तरीका अब भी काम करता है। उसमें मौजूद हर आँकड़ा हिल चुका है।
Image fetching is now common
जब हमने मापा था, बड़ी मात्रा में इमेज खींचने वाले सिर्फ OAI-SearchBot और Googlebot थे। तब से इमेज फेचिंग पूरी क्रॉलर आबादी में फैल चुकी है: अब छह बॉट Googlebot से ज़्यादा शेयर फेच करते हैं, और मूल रूप से नामित दोनों सातवें और दसवें स्थान पर हैं।
llms.txt is measured, not consumed
जब हमने मापा था, किसी बॉट ने कभी /llms.txt की माँग नहीं की थी। यह पूरी तरह बदल चुका है, हालाँकि उस तरह नहीं जैसा इस मानक के समर्थक चाहेंगे। यह लगातार फेच होती है, लगभग पूरी तरह उन टूल्स द्वारा जो यही जाँचने के लिए बने हैं कि आप इसे प्रकाशित करते हैं या नहीं।
जाने-माने बड़े वेंडर क्रॉलर जो इसे फेच करते देखे गए: CCBot, ClaudeBot, Googlebot और GoogleOther। खास तौर पर गैरहाज़िर: GPTBot।
Bytespider does not just check robots.txt
यह खिसकी नहीं, पलट गई। Bytespider अब प्रॉपर्टी का तीसरा सबसे भारी क्रॉलर है और उसकी 94% रिक्वेस्ट कंटेंट हैं।
What Held Up
मूल इनसाइट में से छह लंबी विंडो में ज्यों की त्यों टिकी रहीं, और ये वही हैं जो किसी लीडर का नाम लेने के बजाय व्यवहार का वर्णन करती हैं।
तकनीकी कंटेंट ही उद्धरण कमाता है। मूल सूची का सबसे मज़बूत निष्कर्ष। सभी बारह शीर्ष ChatGPT-User गंतव्य इंप्लीमेंटेशन गाइड, टूल तुलना या तकनीकी विश्लेषण हैं। कुछ भी सामान्य नहीं, कुछ भी प्रचारात्मक नहीं। एक अकेली माइग्रेशन गाइड ने 6,716 रिक्वेस्ट खींचीं, यानी पूरे नेटवर्क के ChatGPT-User ट्रैफिक का 34%।
GPTBot अब भी robots.txt को अनदेखा करता है। 6,872 कंटेंट रिक्वेस्ट के मुकाबले robots.txt की दो रिक्वेस्ट। Meta ने 3,169 में से शून्य कीं।
बर्स्ट कम नहीं, और तेज़ हुए। पीक दरें अब मूल रूप से दर्ज 114 रिक्वेस्ट प्रति मिनट से काफी ऊपर हैं।
वेंडर अब भी बॉट बेड़े चलाते हैं, और हमने उन्हें कम गिना था। OpenAI कम से कम चार अलग क्रॉलर चलाता है, जिनमें एक विज्ञापन क्रॉलर भी है जो अपनी IP रेंज सूची प्रकाशित करता है। Anthropic ClaudeBot, Claude-User और Claude-SearchBot चलाता है। तीन-तीन एक फर्श था, गिनती नहीं।
समन्वित इवेंट असली हैं। मूल पोस्ट में बताई गई ठीक उसी तारीख पर पुष्ट: 19 मार्च को GPTBot 206 रिक्वेस्ट पर और OAI-SearchBot 114 पर दिखता है, छह महीनों में सिर्फ उन दो दिनों में से एक जब दोनों ने वे स्तर एक साथ पार किए।
बॉट अब भी अलग-अलग घंटों में पीक करते हैं, और हर घंटा हिल गया। GPTBot अब 04:00 UTC पर पीक नहीं करता। अब यह 17:00 पर पीक करता है, और यह हमारा मापा हुआ सबसे समय-केंद्रित क्रॉलर है: इसके पूरे छह महीने के वॉल्यूम का 21.4% दिन के उसी एक घंटे में आता है।
What We Could Not Test
दो दिखते हुए निष्कर्ष असल में इस बात के नतीजे निकले कि लॉग कैसे इकट्ठा होते हैं। दोनों बताने लायक हैं, क्योंकि हर एक ऐसी आत्मविश्वासी हेडलाइन बना सकता था जिसे डेटा सहारा नहीं देता।
तुलना प्रॉपर्टी पर robots.txt अदृश्य है। वहाँ किसी भी बॉट से robots.txt की शून्य रिक्वेस्ट लौटीं, जो अनुपालन का नाटकीय निष्कर्ष लगता है, पर है नहीं। वह साइट robots.txt को CDN एज पर सर्व करती है, इसलिए रिक्वेस्ट लॉग होने वाली परत तक पहुँचती ही नहीं। यहाँ robots.txt से जुड़ा हर निष्कर्ष सिर्फ प्राथमिक प्रॉपर्टी से आया है।
CSS और JavaScript वाले निष्कर्ष इस डेटा से किसी भी तरह जाँचे नहीं जा सकते। लॉग सैनिटाइज़र स्टोर करने से पहले .css, .js, फॉन्ट और सोर्स मैप हटा देता है। इनसाइट 9 और 13 को सिर्फ उनके इमेज हिस्से पर जाँचा जा सकता है।
दो छोटी सावधानियाँ। डेटासेट एक नहीं, तीन संबंधित प्रॉपर्टीज पर फैला है, और सबसे ज़्यादा उद्धृत कंटेंट उस नेटवर्क की एक ही साइट पर है, जिससे उद्धरण संबंधी निष्कर्ष एक जगह सिमट जाते हैं। और जुलाई अधूरा महीना है, 13 तारीख तक, इसलिए जुलाई के आँकड़े कम करके दिखाते हैं: Meta इसके बावजूद पहले स्थान पर पहुँचता है।