3 अगस्त 2026 का सप्ताह
ये बॉट्स आखिर किसे बेवकूफ़ बना रहे हैं?
AI क्रॉलर के बारे में जो कुछ लिखा जाता है, उसका अधिकांश हिस्सा लॉग के बजाय वेंडर की घोषणाओं से आता है। ये सवाल दोनों से आते हैं: एक मध्यम आकार की ईकॉमर्स साइट के असली एज लॉग, और वह क्रॉलर डॉक्युमेंटेशन जो AI कंपनियाँ खुद प्रकाशित करती हैं। हर सवाल का जवाब दीजिए और प्रमाण तुरंत सामने आ जाएगा।
- प्रश्न
- 10
- मिनट
- 6
-
1
पिछले हफ्ते किस बॉट ने /sitemap.xml सबसे ज़्यादा बार माँगा?
Microsoft का Bingbot
Bingbot ने इसे दर्जनों बार फ़ेच किया। असली GPTBot, ClaudeBot, PerplexityBot और Gemini क्रॉलर ने इसे एक बार भी फ़ेच नहीं किया, जबकि उन्होंने उसी साइट पर हज़ारों रिक्वेस्ट भेजीं। AI क्रॉलर कंटेंट को ज़्यादातर लिंक फ़ॉलो करके खोजते हैं, sitemap पढ़कर नहीं। sitemap सबमिट करना सर्च इंजन की एक रस्म है; जहाँ तक हमें पता है, AI विज़िबिलिटी के लिए इससे बहुत कम फर्क पड़ता है।
-
2
Google-Extended क्या है?
एक robots.txt टोकन, जो यह तय करता है कि क्रॉल किया गया कंटेंट Gemini को ट्रेन करेगा और उसके जवाबों को आधार देगा या नहीं
यह कभी कोई रिक्वेस्ट भेजता ही नहीं। Google बताता है कि Google-Extended का अपना कोई अलग user-agent नहीं है, इसलिए क्रॉलिंग सामान्य Google क्रॉलर के ज़रिए ही होती है और यह टोकन सिर्फ़ यह तय करता है कि उस कंटेंट के साथ आगे क्या होगा: भविष्य के Gemini मॉडल की ट्रेनिंग, और Gemini Apps तथा Vertex AI में जवाबों को आधार देना। Google यह भी साफ़ कहता है कि इससे Google Search में साइट के शामिल होने पर कोई असर नहीं पड़ता और यह कोई रैंकिंग सिग्नल नहीं है, इसलिए इसे ब्लॉक करने पर Search में कुछ नहीं गँवाना पड़ता और आपका क्रॉल ट्रैफ़िक एक भी हिट कम नहीं होगा।
-
3
यह पक्का करने का एकमात्र भरोसेमंद तरीका क्या है कि कोई रिक्वेस्ट वाकई GPTBot से आई है?
रिवर्स DNS के साथ वेंडर की प्रकाशित IP रेंज
user-agent स्ट्रिंग सिर्फ़ फ्री टेक्स्ट होती हैं। कोई भी उनमें से कुछ भी भेज सकता है, और बहुत सारे स्कैनर भेजते भी हैं।
-
4
एक सामान्य पब्लिशर के लिए OpenAI की कौन सी गतिविधि सबसे ज़्यादा रिक्वेस्ट पैदा करती है?
ChatGPT-User का किसी पेज को इसलिए फ़ेच करना क्योंकि किसी इंसान ने उसके बारे में पूछा
यूज़र की शुरू की हुई फ़ेच ने ट्रेनिंग क्रॉल को लगभग 6 से 1 के अनुपात में पीछे छोड़ दिया। ज़्यादातर AI बॉट ट्रैफ़िक ट्रेनिंग नहीं है, वह किसी असली व्यक्ति के सवाल का रियल टाइम में दिया जा रहा जवाब है।
-
5
आपके लॉग में Google Cloud के किसी IP से OpenAI के लेबल वाला ट्रैफ़िक दिख रहा है। सबसे संभावित वजह क्या है?
नकली user-agent
हमने बिलकुल यही पकड़ा: एक ही Google Cloud नेटवर्क पर मौजूद एक स्कैनर ने 72 घंटों में एक हज़ार से कहीं अधिक रिक्वेस्ट भेजीं, OpenAI, Perplexity और Gemini के user-agent बदल बदल कर, और हर पाथ पर सिर्फ़ एक URL पर हिट किया। यह क्रॉलिंग नहीं, एन्यूमरेशन है। असली OpenAI क्रॉलर Azure से निकलते हैं।
-
6
बड़ी AI कंपनियाँ वेब को कैसे क्रॉल करती हैं, इसका सबसे सही वर्णन कौन सा है?
हर कंपनी अलग अलग कामों के लिए कई अलग बॉट चलाती है
OpenAI के अपने डॉक्युमेंटेशन में चार गिनाए गए हैं: ट्रेनिंग डेटा के लिए GPTBot, किसी इंसान के सवाल पूछने पर लाइव फ़ेच के लिए ChatGPT-User, ChatGPT के सर्च नतीजों के लिए OAI-SearchBot, और विज्ञापन के रूप में सबमिट किए गए पेज जाँचने के लिए OAI-AdsBot। Anthropic और बाकी कंपनियाँ भी यही तरीका अपनाती हैं। OpenAI कहता है कि हर सेटिंग स्वतंत्र है, इसलिए कोई पब्लिशर सर्च में दिखने के लिए OAI-SearchBot को अनुमति दे सकता है और साथ ही GPTBot को रोक सकता है। यानी "क्या मुझे AI बॉट्स को अनुमति देनी चाहिए?" एक फैसला नहीं है, चार हैं।
-
7
आप अपने robots.txt में User-agent: GPTBot के साथ Disallow: / जोड़ते हैं। फिर भी आपकी साइट तक क्या पहुँचता रहता है?
ChatGPT-User और OAI-SearchBot
एक टोकन ब्लॉक करने से एक ही बॉट ब्लॉक होता है। OpenAI कहता है कि हर सेटिंग स्वतंत्र है, इसलिए सर्च क्रॉलर, विज्ञापन क्रॉलर और यूज़र की शुरू की हुई लाइव फ़ेच, सब चलते रहते हैं। ChatGPT-User सबसे पेचीदा मामला है: चूँकि वे रिक्वेस्ट किसी क्रॉल शेड्यूल से नहीं बल्कि किसी व्यक्ति से शुरू होती हैं, OpenAI बताता है कि robots.txt के नियम उन पर लागू ही न हों, यह मुमकिन है। ज़्यादातर "हमने AI को ब्लॉक कर दिया" वाले कॉन्फ़िगरेशन ट्रेनिंग रोक देते हैं और उन बॉट्स को पूरी तरह अछूता छोड़ देते हैं जो असल में यूज़र को दिखने वाले जवाब बनाते हैं।
-
8
एक बड़े क्रॉलर ने ऐसी साइट पर news-sitemap.xml, sitemap.txt, sitemap.html और sitemap-index.xml माँगे, और सब 404 रहे, जबकि उस साइट का robots.txt अपना sitemap सही तरीके से घोषित करता है। इससे क्या पता चलता है?
कुछ क्रॉलर Sitemap डायरेक्टिव पढ़ने के बजाय sitemap फ़ाइल के नाम अंदाज़े से आज़माते रहते हैं
Meta का क्रॉलर ऐसा ही करता है। robots.txt में सही Sitemap लाइन होना इस बात की कोई गारंटी नहीं कि क्रॉलर उसका इस्तेमाल करेगा।
-
9
एक विज़िटर ChatGPT से सवाल पूछता है, आपकी साइट पर क्लिक करके आता है, और कुछ खरीद लेता है। आपका एनालिटिक्स ChatGPT को इसका श्रेय शायद कभी क्यों नहीं देगा?
कई AI क्लाइंट कोई रेफ़रर भेजते ही नहीं, इसलिए वह विज़िट डायरेक्ट के रूप में दर्ज होती है
AI असिस्टेंट से आने वाला रेफ़रर डेटा डिज़ाइन से ही अधूरा है। डेस्कटॉप और मोबाइल ऐप अक्सर कोई referer हेडर भेजते ही नहीं, ऐप के अंदर खुलने वाले ब्राउज़र का व्यवहार एक जैसा नहीं रहता, और कुछ क्लाइंट सिर्फ़ खाली डोमेन भेजते हैं। यह ट्रैफ़िक बुकमार्क और टाइप किए गए URL के साथ डायरेक्ट में जा गिरता है। रेफ़रल की तरफ़ के आँकड़े एक न्यूनतम सीमा हैं, कोई माप नहीं।
-
10
एक सामान्य हफ्ते में AI क्रॉलर का वॉल्यूम पारंपरिक सर्च क्रॉलर के वॉल्यूम के मुकाबले कैसा रहता है?
सर्च अब भी लगभग 20 से 25 गुना बड़ा है
Google और Bing ने मिलकर 72 घंटों में एक लाख से कहीं अधिक रिक्वेस्ट कीं; सभी वेरिफ़ाइड AI क्रॉलर ने मिलकर कुछ हज़ार। AI क्रॉलिंग बढ़ रही है और असली है, लेकिन उसने सर्च क्रॉलिंग की जगह नहीं ली है, और इसके उलट सुझाने वाली सुर्खियाँ आमतौर पर नकली user-agent गिन रही होती हैं।