Skip to main content

हमने AI बॉट्स पर 20 इनसाइट प्रकाशित की थीं। छह महीने बाद, 65% बदल चुकी थीं।

मार्च 2026 में हमने 48 दिनों के सर्वर लॉग से AI बॉट व्यवहार पर 20 निष्कर्ष प्रकाशित किए थे। हमने उन्हें छह महीने के लॉग पर दोबारा जाँचा: जिन 17 को दोबारा जाँचा जा सका, उनमें से 11 बदल चुकी थीं, यानी सूची का 65%, करीब पाँच महीनों में। छह को नए क्रॉलर व्यवहार ने पीछे छोड़ दिया, पाँच में उल्लेखनीय बदलाव आया और छह अब भी कायम हैं। Meta आठ हफ्तों में गैरमौजूद से सबसे भारी AI क्रॉलर बन गया, ChatGPT-User का IP फिंगरप्रिंट उलट गया, llms.txt अब लगातार फेच होती है लेकिन लगभग पूरी तरह स्कैनरों द्वारा, फ्रंटियर लैब्स द्वारा नहीं, और Bytespider robots.txt पर्यटक नहीं बल्कि तीसरा सबसे भारी क्रॉलर निकला।

छह महीने के AI बॉट सर्वर लॉग, जो GPTBot, ChatGPT-User, ClaudeBot, meta-externalagent और Bytespider पर पहले की बीस इनसाइट को दोबारा जाँचते हैं
छह महीने के AI बॉट सर्वर लॉग, जो GPTBot, ChatGPT-User, ClaudeBot, meta-externalagent और Bytespider पर पहले की बीस इनसाइट को दोबारा जाँचते हैं
क्या बदला
  1. 55% of what we published had changed within five months. दोबारा जाँची गई सत्रह इनसाइट में से ग्यारह हिल गईं: छह को नए क्रॉलर व्यवहार ने पीछे छोड़ दिया और पाँच में उल्लेखनीय बदलाव आया। छह अब भी कायम हैं। 1 फरवरी से 13 जुलाई 2026 के बीच तीन प्रॉपर्टीज पर दोबारा जाँच की गई, और हर इनसाइट के नीचे उसका फैसला दर्ज है।
  2. Rankings churn. Behaviours do not. बर्स्ट क्रॉलिंग, समन्वित वेंडर इवेंट और तकनीकी कंटेंट की ओर झुकाव, तीनों लंबी अवधि में भी टिके रहे। हमने जो भी विशिष्ट बॉट नाम, अनुपात और पीक आवर प्रकाशित किया था, वह हिल चुका है। 2026 की पहली तिमाही की बॉट सूची पर बनी कोई भी चीज़ अभी से ट्रैफिक की गलत पहचान कर रही है।
  3. Meta went from absent to the heaviest AI crawler in eight weeks. मई तक शून्य रिक्वेस्ट, फिर जून में 553 और जुलाई के पहले तेरह दिनों में 2,615, और robots.txt की एक भी जाँच नहीं। पूरे छह महीनों में यह अब भी सिर्फ बारहवें स्थान पर है, और यही वजह है कि क्रॉल बजट का फैसला किसी एक विंडो की रैंकिंग पर नहीं टिकाना चाहिए।
  4. The IP fingerprint inverted.
    ChatGPT-User: तब लगभग 1:1, अब 12.4 रिक्वेस्ट प्रति IP, 1,588 पतों पर
    GPTBot: तब 2 IP, अब 129
    जिस लगभग 1:1 सिग्नेचर का हमने वर्णन किया था, वह अब 1.4 पर Claude-User का है। तरीका अब भी काम करता है; फिंगरप्रिंट हर तिमाही दोबारा मापने होंगे।
  5. llms.txt is measured, not consumed. पहले कोई फेच नहीं करता था, अब लगातार फेच होती है, लेकिन ज़्यादातर खास तौर पर बने स्कैनर, AI-रेडीनेस ऑडिटर और रिसर्च प्रोब द्वारा, फ्रंटियर लैब्स द्वारा नहीं। CCBot, ClaudeBot और Googlebot इसे फेच करते हैं। GPTBot नहीं करता।

Why We Re-Tested Our Own Insights

मार्च 2026 में हमने AI बॉट व्यवहार पर बीस निष्कर्ष प्रकाशित किए थे, जो एक ही प्रॉपर्टी के 48 दिनों के सर्वर लॉग से निकले थे। एक लंबी, बाद की विंडो ने उनके साथ यह किया।

बॉट रिसर्च जल्दी पुरानी पड़ती है, और ज़्यादातर की कभी जाँच ही नहीं होती। हम जानना चाहते थे कि कितनी जल्दी, इसलिए हमने मूल सूची को तीन प्रॉपर्टीज पर छह महीने के लॉग के मुकाबले दोबारा चलाया और हर इनसाइट के लिए एक फैसला दर्ज किया। सत्रह को दोबारा जाँचा जा सका। उनमें से ग्यारह पाँच महीनों के भीतर हिल चुकी थीं।

मूल लेख अब भी ठीक वैसा ही प्रकाशित है: AI बॉट ट्रैफिक तेज़ी से बढ़ रहा है, 48-दिन का अध्ययन। वहाँ चुपचाप कुछ भी संपादित नहीं किया गया। यह लेख उसका ऑडिट है।

The 20 Takeaways, Re-Tested Six Months Later

मूल इनसाइट कैसे पुरानी पड़ीं · 17 में से 11 पाँच महीनों में बदलीं
6पीछे छूटीं
6कायम हैं
5बदलीं

पीछे छूटी और बदली हुई इनसाइट मिलकर करीब पाँच महीनों में 17 में से 11 इनसाइट बनती हैं, यानी सूची का 65%। हर फैसला बताता है कि क्रॉलर आबादी ने आगे क्या किया, न कि मूल माप में कोई खामी। फैसले एक बाद की, लंबी विंडो से आए हैं: 1 फरवरी से 13 जुलाई 2026 के बीच तीन प्रॉपर्टीज पर 154,864 वर्गीकृत रिक्वेस्ट, जिन्हें एक बड़ी ईकॉमर्स प्रॉपर्टी से क्रॉस-रेफरेंस किया गया।

  1. 01बदली

    आपकी sitemap.xml अभी ज़्यादा अहम हो गई है। GPTBot और ClaudeBot दोनों ने मार्च 2026 में sitemap की खपत को ऊँचे स्तर पर पहुँचाया और फिर पीछे नहीं देखा। अगर आपका sitemap पुराना, अधूरा या भाषा वेरिएंट के बिना है, तो AI क्रॉलर कंटेंट चूक जाएँगे।

    छह महीने बाद 20/07/26 तकsitemap की खपत फिर चढ़ी और वहीं टिकी रही। ClaudeBot अब बड़े अंतर से सबसे बड़ा उपभोक्ता है, करीब Googlebot से 6x, और दोनों बॉट फरवरी में ही sitemap फेच कर रहे थे, इसलिए मार्च शुरुआत नहीं बल्कि एस्केलेशन था।

  2. 02कायम

    robots.txt का सार्वभौमिक पालन नहीं होता। GPTBot और Meta-WebIndexer इसे कभी नहीं जाँचते। अगर आपकी AI कंटेंट रणनीति robots.txt निर्देशों पर टिकी है, तो जान लें कि दो सबसे सक्रिय क्रॉलर उन्हें पूरी तरह अनदेखा करते हैं।

    छह महीने बाद 20/07/26 तकGPTBot ने 6,872 कंटेंट रिक्वेस्ट के मुकाबले robots.txt की 2 रिक्वेस्ट कीं। Meta ने 3,169 में से शून्य कीं। दोनों पर पुष्टि हुई।

  3. 03पीछे छूटी

    ChatGPT-User ट्रैफिक AI बातचीत में ब्रांड उद्धरण का सीधा संकेत है। हर रिक्वेस्ट एक असली व्यक्ति को दर्शाती है जो आपका URL ChatGPT में पेस्ट कर रहा है। यह मापने लायक माउथ-टू-माउथ प्रचार है, और यह तेज़ी से बढ़ रहा है।

    छह महीने बाद 20/07/26 तकपाँच महीनों में 11% ऊपर, बीच में एक गिरावट के साथ: फरवरी में 3,827 के मुकाबले जून में 4,236। संकेत असली है, और जिस विंडो को हमने मापा था उसके बाद वृद्धि सपाट हो गई।

  4. 04कायम

    AI बॉट बर्स्ट में क्रॉल करते हैं, लगातार धारा में नहीं। GPTBot ने 3 मिनट की विंडो में 114 req/min छुए। अगर आपका सर्वर बर्स्ट ट्रैफिक नहीं झेल सकता, तो इंडेक्सिंग रन के दौरान AI क्रॉलर थ्रॉटल हो सकते हैं या एरर पा सकते हैं।

    छह महीने बाद 20/07/26 तकपुष्ट और और तीव्र। पीक अब 270 रिक्वेस्ट प्रति मिनट है, और चार बॉट 130 से ऊपर हैं।

  5. 05कायम

    OpenAI और Anthropic, दोनों 3-3 अलग बॉट चलाते हैं। एक ट्रेनिंग/इंडेक्सिंग के लिए, एक सर्च के लिए, एक लाइव यूज़र सेशन के लिए। एक को ब्लॉक करने से बाकी ब्लॉक नहीं होते। आपकी robots.txt में हर एक के लिए अलग निर्देश चाहिए।

    छह महीने बाद 20/07/26 तकयह ऊपरी नहीं, निचली सीमा है। OpenAI अब कम से कम चार चलाता है, जिनमें एक विज्ञापन क्रॉलर भी है जो अपनी IP रेंज सूची प्रकाशित करता है। तीन-तीन एक फर्श है, गिनती नहीं।

  6. 06पीछे छूटी

    OAI-SearchBot और Googlebot ही ऐसे बॉट हैं जो बड़ी मात्रा में इमेज फेच करते हैं। अगर आपके लेख की इमेज में असल कंटेंट है (चार्ट, डायग्राम, डेटा विज़ुअलाइज़ेशन), तो यही बॉट उन्हें सर्च रिज़ल्ट में इस्तेमाल करेंगे।

    छह महीने बाद 20/07/26 तकअब छह बॉट Googlebot से ज़्यादा इमेज शेयर फेच करते हैं। यहाँ नामित दोनों 7वें और 10वें स्थान पर हैं। इमेज फेचिंग अब पूरी क्रॉलर आबादी में आम है।

  7. 07बदली

    ChatGPT-User सिर्फ टेक्स्ट निकालता है। शून्य इमेज, शून्य CSS, शून्य JS। आपका HTML कंटेंट ही AI बातचीत में खिंचता है। AI विजिबिलिटी के लिए संरचित, साफ टेक्स्ट विज़ुअल डिज़ाइन से ज़्यादा मायने रखता है।

    छह महीने बाद 20/07/26 तकलगभग वैसा ही, पर अब शून्य नहीं: 95.3% पेज के मुकाबले 1.9% इमेज। इसका CSS और JavaScript वाला हिस्सा जाँचा नहीं जा सकता, क्योंकि लॉग पाइपलाइन उन फाइलों को स्टोर करने से पहले हटा देती है।

  8. 08बदली

    AI क्रॉलर अलग-अलग घंटों में पीक करते हैं। GPTBot 04:00 UTC पर आता है। Claude-SearchBot रात भर पीक करता है। PerplexityBot 23:00, 05:00 और 09:00 पर बर्स्ट करता है। अगर आप साइट में बदलाव US के ऑफ-पीक घंटों में तैनात करते हैं, तो उन्हें सबसे पहले AI बॉट देख सकते हैं।

    छह महीने बाद 20/07/26 तकपैटर्न कायम है और हर विशिष्ट घंटा हिल चुका है। GPTBot अब 17:00 UTC पर पीक करता है, और यह हमारा मापा हुआ सबसे समय-केंद्रित क्रॉलर है, जिसकी पूरी वॉल्यूम का 21.4% उसी एक घंटे में आता है।

  9. 09बदली

    वॉल्यूम के लिहाज़ से Meta सबसे आक्रामक AI क्रॉलर है। इस डेटासेट में Meta-WebIndexer ने किसी भी दूसरे बॉट से ज़्यादा रिक्वेस्ट भेजीं, और robots.txt की एक भी जाँच नहीं की। अगर आप Meta के क्रॉलर ट्रैक नहीं कर रहे, तो आप सबसे बड़े खिलाड़ी को चूक रहे हैं।

    छह महीने बाद 20/07/26 तकलिखते समय यह डेटा से आगे निकल गई थी और अब डेटा इसके बराबर आ रहा है। पूरे छह महीनों में Meta 12वें स्थान पर है। जुलाई में यह प्रॉपर्टी का अकेला सबसे भारी AI क्रॉलर है, जबकि मई तक यह पूरी तरह गैरमौजूद था।

  10. 10पीछे छूटी

    llms.txt को अपनाना अब भी सैद्धांतिक है। 48 दिनों में किसी AI बॉट ने /llms.txt की माँग नहीं की। यह आगे चलकर मानक बन सकती है, पर फिलहाल कोई क्रॉलर इसे नहीं खोजता।

    छह महीने बाद 20/07/26 तकतब से यह लगातार फेच होने लगी है, लेकिन ज़्यादातर स्कैनर, ऑडिटर और रिसर्च प्रोब द्वारा, फ्रंटियर लैब्स द्वारा नहीं। CCBot, ClaudeBot और Googlebot इसे फेच करते हैं। GPTBot नहीं करता।

  11. 11बदली

    Applebot आपके पेज पूरी तरह रेंडर करता है। यह CSS, JS और इमेज फेच करता है (इसके ट्रैफिक का 47%)। अगर आपके कंटेंट को पूरा होने के लिए JavaScript रेंडरिंग चाहिए, तो Applebot उसे देखेगा, पर ज़्यादातर AI बॉट नहीं देखेंगे।

    छह महीने बाद 20/07/26 तकदिशा सही, पर स्तर अब काफी नीचे: Applebot के ट्रैफिक में इमेज 27.6% हैं, तब के 47% के मुकाबले। CSS और JavaScript वाला हिस्सा यहाँ उसी पाइपलाइन वजह से जाँचा नहीं जा सकता जो ऊपर इनसाइट 9 में बताई गई है।

  12. 12कायम

    तकनीकी, हाउ-टू कंटेंट का AI बातचीत में सबसे ज़्यादा हवाला दिया जाता है। शीर्ष ChatGPT-User पेज सभी इंप्लीमेंटेशन गाइड और तकनीकी व्याख्या थे। गहरा, विशिष्ट कंटेंट AI उद्धरण कमाता है।

    छह महीने बाद 20/07/26 तकमूल सूची का सबसे मज़बूत निष्कर्ष। सभी बारह शीर्ष गंतव्य इंप्लीमेंटेशन गाइड, टूल तुलना या तकनीकी विश्लेषण हैं। कुछ भी सामान्य नहीं, कुछ भी प्रचारात्मक नहीं। एक अकेली माइग्रेशन गाइड ने नेटवर्क के कुल ChatGPT-User ट्रैफिक का 34% खींचा।

  13. 13पीछे छूटी

    Bytespider और CCBot सिर्फ robots.txt जाँचते हैं और कभी क्रॉल नहीं करते। वे आपके robots.txt निर्देश पढ़ते हैं पर उन पर आगे कुछ नहीं करते। यह बदल सकता है, पर फिलहाल वे शून्य कंटेंट इंडेक्सिंग के साथ अनुपालन का बोझ पैदा करते हैं।

    छह महीने बाद 20/07/26 तकहमारे मापने के बाद यह पलट गया। Bytespider अब प्रॉपर्टी का तीसरा सबसे भारी क्रॉलर है, और उसकी 16,810 रिक्वेस्ट में से 94% अनुपालन नहीं, कंटेंट हैं।

  14. 14कायम

    AI क्रॉल वॉल्यूम रातोंरात बदल सकता है। GPTBot एक ही हफ्ते में 0 से 187 रिक्वेस्ट पर पहुँचा। आपके क्रॉल बजट अनुमानों को क्रमिक वृद्धि नहीं, अचानक छलाँगों को ध्यान में रखना होगा।

    छह महीने बाद 20/07/26 तकपुष्ट, और मूल रूप से दिए गए उदाहरण से साफ उदाहरण के साथ। Meta करीब आठ हफ्तों में शून्य से 2,615 रिक्वेस्ट प्रति महीने पर पहुँचा।

  15. 15पीछे छूटी

    IP विश्लेषण बॉट की पहचान उजागर करता है। ChatGPT-User का लगभग 1:1 IP-से-रिक्वेस्ट अनुपात व्यक्तिगत यूज़र सेशन साबित करता है। GPTBot के 2 IP केंद्रीकृत इंफ्रास्ट्रक्चर साबित करते हैं। IP पैटर्न असली यूज़र-ट्रिगर्ड फेच को स्वचालित क्रॉलिंग से अलग करने में मदद करते हैं।

    छह महीने बाद 20/07/26 तकतरीका टिका रहा और उसमें मौजूद हर आँकड़ा हिल गया। ChatGPT-User अब 1,588 पतों पर 12.4 रिक्वेस्ट प्रति IP चलाता है। GPTBot 129 IP चलाता है, 2 नहीं। यहाँ वर्णित लगभग 1:1 फिंगरप्रिंट अब 1.4 पर Claude-User का है।

  16. 16कायम

    समन्वित क्रॉल इवेंट बॉट परिवारों में होते हैं। GPTBot और OAI-SearchBot 19 मार्च को एक ही Microsoft इंफ्रास्ट्रक्चर से एक साथ चले। जब एक OpenAI बॉट तेज़ होता है, तो बाकी के भी पीछे आने की उम्मीद रखें।

    छह महीने बाद 20/07/26 तकबताई गई ठीक उसी तारीख पर स्वतंत्र रूप से पुष्ट, छह महीनों में सिर्फ उन दो दिनों में से एक जब दोनों बॉट उन स्तरों को एक साथ पार कर गए।

  17. 17पीछे छूटी

    जिन बॉट के नाम आपने कभी नहीं सुने, वे पहले से आ रहे हैं। PromptingBot, LinkupBot, Brightbot, Observer और दूसरे सक्रिय रूप से कंटेंट क्रॉल कर रहे हैं। AI बॉट का परिदृश्य जाने-माने नामों से कहीं बड़ा है।

    छह महीने बाद 20/07/26 तकनामित चारों बॉट ने नए छह महीनों में शून्य रिक्वेस्ट कीं। मूल बात पूरी तरह अलग कलाकारों के साथ टिकी रहती है: लंबी पूँछ पर अब llms.txt स्कैनर और AI-रेडीनेस ऑडिटर हावी हैं। किसी भी नामित सूची की उम्र कुछ महीने ही होती है।

This data is representative of wislr.com only and should not be read as an overall industry trend. Our intent is to spark conversation, share data, and encourage brands to inspect this for themselves.


What Six Months of Logs Changed

मूल अध्ययन एक ही प्रॉपर्टी पर 48 दिन चला था। यह दोबारा जाँच 1 फरवरी से 13 जुलाई 2026 के बीच तीन प्रॉपर्टीज पर 154,864 वर्गीकृत रिक्वेस्ट को कवर करती है, जिन्हें 7.26 मिलियन रिक्वेस्ट वाली एक बड़ी ईकॉमर्स प्रॉपर्टी से क्रॉस-रेफरेंस किया गया, और बॉट पहचान 75-पैटर्न वाली रेफरेंस टेबल के मुकाबले user-agent से तय की गई।

यहाँ के स्रोत कैसे पढ़ें

मूल 48-दिन का अध्ययन एक साइट पर था और उसने यह कहा भी था। यह दोबारा जाँच हमारी चलाई तीन प्रॉपर्टीज पर फैली है, जिन्हें Site A, Site B और Site C कहा गया है, साथ में एक बड़ी तुलना प्रॉपर्टी भी है। हम इन लेबल को डोमेन से नहीं जोड़ते, इसलिए छह महीने के आँकड़े बिना श्रेय के दर्ज हैं।

जिन सत्रह इनसाइट को हम दोबारा जाँच सके, उनमें से ग्यारह पाँच महीनों के भीतर हिल गईं, छह को नए क्रॉलर व्यवहार ने पीछे छोड़ा और पाँच में उल्लेखनीय बदलाव आया। यह दर ही निष्कर्ष है। इसके नीचे का पैटर्न किसी एक सुधार से ज़्यादा मायने रखता है: व्यवहार टिके रहे और आँकड़े हिल गए। बर्स्ट, समन्वित वेंडर इवेंट, तकनीकी कंटेंट की ओर झुकाव, सब अब भी मौजूद हैं। हमने जो भी विशिष्ट बॉट नाम, अनुपात और पीक आवर प्रकाशित किया था, वह बदल चुका है।

रैंकिंग अस्थिर है। व्यवहार स्थिर हैं। 2026 की पहली तिमाही की बॉट सूची पर आपने जो भी बनाया, वह अभी से ट्रैफिक की गलत पहचान कर रहा है।

Meta went from absent to first in eight weeks

डेटासेट का सबसे बड़ा बदलाव। meta-externalagent ने मई तक कुछ भी दर्ज नहीं किया, उस महीने एक अकेली रिक्वेस्ट, फिर जून में 553 और जुलाई के पहले तेरह दिनों में 2,615। यह अब प्रॉपर्टी का सबसे भारी AI क्रॉलर है, और जुलाई अधूरा महीना है, इसलिए वह आँकड़ा इसे कम करके दिखाता है।

मासिक रिक्वेस्ट: सपाट ChatGPT-User के मुकाबले Meta का स्टेप फंक्शन
फरवरी से जुलाई 2026 · जुलाई अधूरा है, 13 तारीख तक
meta-externalagentChatGPT-User

पूरे छह महीनों में Meta बारहवें स्थान पर है। जुलाई में यह पहले स्थान पर है। दोनों बातें सही हैं, और यही वजह है कि क्रॉल बजट का फैसला किसी एक विंडो की रैंकिंग पर टिकाना ठीक नहीं। इसने 3,169 हिट में robots.txt की शून्य रिक्वेस्ट भी कीं।

The bot rankings churn, the behaviours do not

चौदह बॉट, जिनका वॉल्यूम महीने दर महीने ट्रैक करने लायक है। देखिए कि फरवरी से जुलाई तक इस आबादी की शक्ल खुद से कितनी कम मिलती है।

हर ट्रैक किया गया बॉट, महीने दर महीने
छह महीने के वॉल्यूम से क्रमित · हर पैनल अपने खुद के अधिकतम पर स्केल किया गया · Meta लाल रंग में

The IP fingerprint inverted

मूल पाठ में यूज़र-ट्रिगर्ड फेच को केंद्रीकृत क्रॉलिंग से अलग करने के लिए रिक्वेस्ट प्रति IP का इस्तेमाल हुआ था। तरीका अब भी काम करता है। उसमें मौजूद हर आँकड़ा हिल चुका है।

रिक्वेस्ट प्रति अलग IP
PerplexityBot90.2
GPTBot53.3
ClaudeBot41.4
ChatGPT-User12.4
Claude-User1.4

मूल विंडो में ChatGPT-User लगभग 1:1 पर था और अब 1,588 पतों पर 12.4 रिक्वेस्ट प्रति IP चलाता है: OpenAI ने उस ट्रैफिक को कम, पर ज़्यादा व्यस्त एग्रेस IP के पीछे समेट दिया है। GPTBot 129 IP चलाता है, वे 2 नहीं जो हमने दर्ज किए थे। जिस लगभग 1:1 सिग्नेचर का हमने वर्णन किया था, वह अब Claude-User का है।

तरीका अब भी काम करता है। फिंगरप्रिंट हर तिमाही दोबारा मापने होंगे।

Image fetching is now common

जब हमने मापा था, बड़ी मात्रा में इमेज खींचने वाले सिर्फ OAI-SearchBot और Googlebot थे। तब से इमेज फेचिंग पूरी क्रॉलर आबादी में फैल चुकी है: अब छह बॉट Googlebot से ज़्यादा शेयर फेच करते हैं, और मूल रूप से नामित दोनों सातवें और दसवें स्थान पर हैं।

उस बॉट की कुल रिक्वेस्ट में इमेज का हिस्सा
Storebot-Google53.5%
TikTokSpider41.4%
Bytespider37.7%
DuckDuckBot33.8%
Applebot27.6%
GoogleOther26.7%
Googlebot18.4%
GPTBot16.5%
bingbot16.0%
OAI-SearchBot12.6%

हाइलाइट की गई पंक्तियाँ वे दो बॉट हैं जिन्हें हमने मूल रूप से बड़ी मात्रा में इमेज फेच करने वाले अकेले बॉट बताया था।

llms.txt is measured, not consumed

जब हमने मापा था, किसी बॉट ने कभी /llms.txt की माँग नहीं की थी। यह पूरी तरह बदल चुका है, हालाँकि उस तरह नहीं जैसा इस मानक के समर्थक चाहेंगे। यह लगातार फेच होती है, लगभग पूरी तरह उन टूल्स द्वारा जो यही जाँचने के लिए बने हैं कि आप इसे प्रकाशित करते हैं या नहीं।

llms.txt कौन फेच करता हैरिक्वेस्ट
सामान्य स्क्रिप्ट (curl, node, axios)66
खास तौर पर बने llms.txt स्कैनर50
रिसर्च प्रोब, जिनमें एक प्रॉम्प्ट-इंजेक्शन सर्वे भी शामिल है42
AI-रेडीनेस और ऑडिट क्रॉलर34
इंडेक्सिंग स्टार्टअप33

जाने-माने बड़े वेंडर क्रॉलर जो इसे फेच करते देखे गए: CCBot, ClaudeBot, Googlebot और GoogleOther। खास तौर पर गैरहाज़िर: GPTBot

llms.txt प्रकाशित करने से AI-विजिबिलिटी टूलिंग इंडस्ट्री आपको मापने लगती है। इससे फ्रंटियर लैब्स आपको अभी पढ़ती नहीं हैं।

Bytespider does not just check robots.txt

यह खिसकी नहीं, पलट गई। Bytespider अब प्रॉपर्टी का तीसरा सबसे भारी क्रॉलर है और उसकी 94% रिक्वेस्ट कंटेंट हैं।

बॉटकुलrobots.txtपेजइमेज
Bytespider16,8101,0864,8786,339
CCBot730706736

What Held Up

मूल इनसाइट में से छह लंबी विंडो में ज्यों की त्यों टिकी रहीं, और ये वही हैं जो किसी लीडर का नाम लेने के बजाय व्यवहार का वर्णन करती हैं।

तकनीकी कंटेंट ही उद्धरण कमाता है। मूल सूची का सबसे मज़बूत निष्कर्ष। सभी बारह शीर्ष ChatGPT-User गंतव्य इंप्लीमेंटेशन गाइड, टूल तुलना या तकनीकी विश्लेषण हैं। कुछ भी सामान्य नहीं, कुछ भी प्रचारात्मक नहीं। एक अकेली माइग्रेशन गाइड ने 6,716 रिक्वेस्ट खींचीं, यानी पूरे नेटवर्क के ChatGPT-User ट्रैफिक का 34%।

GPTBot अब भी robots.txt को अनदेखा करता है। 6,872 कंटेंट रिक्वेस्ट के मुकाबले robots.txt की दो रिक्वेस्ट। Meta ने 3,169 में से शून्य कीं।

बर्स्ट कम नहीं, और तेज़ हुए। पीक दरें अब मूल रूप से दर्ज 114 रिक्वेस्ट प्रति मिनट से काफी ऊपर हैं।

पीक रिक्वेस्ट प्रति मिनट
Storebot-Google270
ChatGPT-User221
Googlebot172
DuckAssistBot152
Applebot132

वेंडर अब भी बॉट बेड़े चलाते हैं, और हमने उन्हें कम गिना था। OpenAI कम से कम चार अलग क्रॉलर चलाता है, जिनमें एक विज्ञापन क्रॉलर भी है जो अपनी IP रेंज सूची प्रकाशित करता है। Anthropic ClaudeBot, Claude-User और Claude-SearchBot चलाता है। तीन-तीन एक फर्श था, गिनती नहीं।

समन्वित इवेंट असली हैं। मूल पोस्ट में बताई गई ठीक उसी तारीख पर पुष्ट: 19 मार्च को GPTBot 206 रिक्वेस्ट पर और OAI-SearchBot 114 पर दिखता है, छह महीनों में सिर्फ उन दो दिनों में से एक जब दोनों ने वे स्तर एक साथ पार किए।

बॉट अब भी अलग-अलग घंटों में पीक करते हैं, और हर घंटा हिल गया। GPTBot अब 04:00 UTC पर पीक नहीं करता। अब यह 17:00 पर पीक करता है, और यह हमारा मापा हुआ सबसे समय-केंद्रित क्रॉलर है: इसके पूरे छह महीने के वॉल्यूम का 21.4% दिन के उसी एक घंटे में आता है।

बॉटपीक आवर (UTC)उस घंटे में उसके ट्रैफिक का हिस्सा
GPTBot17:0021.4%
ChatGPT-User16:0010.1%
Bytespider19:009.0%
Applebot00:007.8%
bingbot03:006.5%

What We Could Not Test

दो दिखते हुए निष्कर्ष असल में इस बात के नतीजे निकले कि लॉग कैसे इकट्ठा होते हैं। दोनों बताने लायक हैं, क्योंकि हर एक ऐसी आत्मविश्वासी हेडलाइन बना सकता था जिसे डेटा सहारा नहीं देता।

तुलना प्रॉपर्टी पर robots.txt अदृश्य है। वहाँ किसी भी बॉट से robots.txt की शून्य रिक्वेस्ट लौटीं, जो अनुपालन का नाटकीय निष्कर्ष लगता है, पर है नहीं। वह साइट robots.txt को CDN एज पर सर्व करती है, इसलिए रिक्वेस्ट लॉग होने वाली परत तक पहुँचती ही नहीं। यहाँ robots.txt से जुड़ा हर निष्कर्ष सिर्फ प्राथमिक प्रॉपर्टी से आया है।

CSS और JavaScript वाले निष्कर्ष इस डेटा से किसी भी तरह जाँचे नहीं जा सकते। लॉग सैनिटाइज़र स्टोर करने से पहले .css, .js, फॉन्ट और सोर्स मैप हटा देता है। इनसाइट 9 और 13 को सिर्फ उनके इमेज हिस्से पर जाँचा जा सकता है।

दो छोटी सावधानियाँ। डेटासेट एक नहीं, तीन संबंधित प्रॉपर्टीज पर फैला है, और सबसे ज़्यादा उद्धृत कंटेंट उस नेटवर्क की एक ही साइट पर है, जिससे उद्धरण संबंधी निष्कर्ष एक जगह सिमट जाते हैं। और जुलाई अधूरा महीना है, 13 तारीख तक, इसलिए जुलाई के आँकड़े कम करके दिखाते हैं: Meta इसके बावजूद पहले स्थान पर पहुँचता है।

निष्कर्ष निकालने से पहले जाँचें कि आपकी लॉगिंग पाइपलाइन क्या फेंक देती है। हमारे अपने दो निष्कर्ष सैनिटाइज़र के नतीजे थे।