AI Crawlers Also Reach You by Following Backlinks
एक crawler-फोरेंसिक परिकल्पना। आपके सर्वर लॉग में पहले से उन थर्ड-पार्टी पेजों की एक मोटी सूची मौजूद है जो सबसे ज़्यादा संभावना से यह खिला रहे हैं कि AI आपके ब्रांड के बारे में क्या कहता है। आप लगभग निश्चित रूप से यह डेटा इकट्ठा कर रहे हैं और यह संकेत फेंक रहे हैं।
ज़्यादातर लोग AI crawler की कल्पना उसी तरह करते हैं जैसे वे Googlebot की करते हैं: यह आपका sitemap पढ़ता है, आपके आंतरिक लिंक पर चलता है, और आपके पेज indexing करता है। ऐसा होता है। पर GPTBot और बाकी आप तक पहुँचने का यही इकलौता रास्ता नहीं है।
वे एक backlink फॉलो करके भी आते हैं: एक फोरम थ्रेड जो आपकी तुलना किसी प्रतिस्पर्धी से करता है, किसी ऐसी साइट पर एक रिव्यू जिसका नाम आपने कभी सुना नहीं, एक राउंडअप लेख जो आपके प्रोडक्ट पेज को लिंक करता है। जब कोई AI crawler उनमें से किसी लिंक को फॉलो करता है, तो यह लगभग रियल टाइम के करीब होता है और एक timestamp के साथ आपके access logs में उतरता है।
यह पता लगाने का आम तरीका कि कौन से थर्ड-पार्टी पेज AI के जवाब आकार दे रहे हैं, यह है कि ChatGPT, Perplexity और बाकियों को प्रॉम्प्ट किया जाए और उनके लौटाए JSON में से स्रोत निकाल लिए जाएँ। यह काम करता है, और आपको यह करना चाहिए। पर यह समस्या को बाहर से देखता है, एक बार में एक प्रॉम्प्ट। आपके अपने लॉग आपको अंदर से देखने देते हैं, लगातार, ऐसे डेटा पर जिसे कोई रेट-लिमिट या छीन नहीं सकता।
Most Crawlers Will Not Tell You Where They Came From
एक backlink-फॉलो तभी उपयोगी है जब crawler आपको बताए कि उसने कौन सा पेज फॉलो किया, और वह एक ही जगह रहता है: Referer header में जो crawler अपने अनुरोध के साथ भेजता है।
LLM crawler में से लगभग कोई इसे नहीं भेजता। वे आपका पेज फ़ेच करते हैं और इस बारे में कुछ भी दर्ज नहीं करते कि वे कहाँ से आए। आप विज़िट देखते हैं। आप स्रोत नहीं देखते।
तो जिस crawl की आपको परवाह है उसका ज़्यादातर हिस्सा स्रोत पर गुमनाम है। आप साबित कर सकते हैं कि एक AI बॉट ने विज़िट किया। आप यह साबित नहीं कर सकते कि उसे किसने भेजा। एक crawler उस खाई को पाटता है।
PetalBot Is the Exception
PetalBot, Huawei के Petal Search के पीछे का crawler है। यह किसी AI लैब का बॉट नहीं है। पर यह एक काम करता है जो लगभग और कोई नहीं करता: अपने अनुरोधों पर, यह referring URL रिपोर्ट करता है। ठीक वही थर्ड-पार्टी पेज जिसे फॉलो करके यह आपके पेज तक पहुँचा, query string समेत सब कुछ।
हमारे लॉग में, यह व्यवहार कभी-कभार का नहीं है। यह नियम है।
PetalBot की एक लॉग लाइन उस खाई को पाट देती है। एक सामान्य AI-crawler हिट आपको बताती है कि एक बॉट आया। एक PetalBot हिट आपको बताती है कि एक बॉट आया और उस पेज का नाम बताती है जिसने उसे भेजा।
203.0.113.x - - [20/Jul/2026:14:22:07 +0000] "GET /products/widget-pro HTTP/1.1" 200 18244 "https://forum.example.com/thread/best-widgets-2026?sort=top" "PetalBot"
हम PetalBot को उन अधिक शिष्ट crawler में भी गिनते हैं जो हम देखते हैं, जिसे हमारे लॉग में प्रति मिनट चरम अनुरोधों से मापा गया है। यह आपके origin को हथौड़े नहीं मार रहा। इसे छोड़ देने की परिचालन लागत बहुत कम है, और इसे ब्लॉक करने की एक असली संकेत-लागत है।
PetalBot and the LLM Crawlers Read the Same Web
अगला कदम वह है जहाँ यह तरीका अवलोकन होना बंद कर देता है और अनुमान बन जाता है।
PetalBot और LLM crawler काफ़ी हद तक एक ही वेब पढ़ रहे हैं। वे एक ही लिंक फॉलो करते हैं, उन्हीं रिव्यू साइटों और फोरमों और तुलना वाले लेखों से, क्योंकि आपके ब्रांड के ज़िक्र वहीं रहते हैं। तो जब PetalBot आपको एक referring URL सौंपता है, तो वह एक ऐसे पेज की ओर इशारा कर रहा है जिसे AI crawler भी संभावित रूप से पढ़ रहे हैं।
PetalBot अपना referrer रिपोर्ट करता है और LLM crawler नहीं करते। जो यह रिपोर्ट करता है उसे उसके विकल्प के तौर पर इस्तेमाल करें जो वे छुपाते हैं।
यह तकनीक त्रिकोणीयकरण है। आप लक्ष्य को सीधे नहीं देख सकते, इसलिए आप कोई ऐसी चीज़ मापते हैं जो उसके साथ चलती है। यहाँ, मापने योग्य चीज़ PetalBot का रेफ़रल ट्रेल है, जो एक ऐसी लॉग फ़ाइल में बैठा है जो पहले से आपकी अपनी है।
Build the Graph: From Raw Logs to a Citation Shortlist
इसमें से किसी के लिए किसी नए टूल की ज़रूरत नहीं। इसके लिए वे लॉग चाहिए जो आप पहले से इकट्ठा करते हैं और कुछ फ़िल्टरिंग कदम।
Edge पर लॉग करें, और Referer header रखें
अनुरोधों को सर्वर या CDN पर कैप्चर करें, किसी JavaScript टैग में नहीं, क्योंकि crawler टैग नहीं चलाते। यह पूरा तरीका जिस एक फ़ील्ड पर निर्भर है वह है Referer। अगर आपकी लॉगिंग इसे छाँट देती है, या query strings छोटा कर देती है, तो पहले उसे ठीक करें। जो header आपने कभी संग्रहीत ही नहीं किया उसे आप वापस नहीं पा सकते।
उन PetalBot हिट्स तक फ़िल्टर करें जो कोई थर्ड-पार्टी referrer साथ लाती हैं
PetalBot के user-agent का मिलान करें, फिर सिर्फ़ वे हिट्स रखें जिनका referrer किसी ऐसे डोमेन की ओर इशारा करता है जो आपका नहीं है। वे बाहरी referrer आपके citation candidate हैं। खुद-की-ओर रेफ़रल और खाली referrer हटा दें; इस मकसद के लिए वे शोर हैं।
पेजों तक डीडुप्लिकेट करें, फिर डोमेन तक समेटें
वही फोरम थ्रेड कई बार दिखाई देगा। दोहराए गए URL को अलग-अलग पेजों में समेटें, फिर पेजों को उनके डोमेन के तहत समूहित करें। अब आपके पास दो दृश्य हैं: वे अलग-अलग पेज जो आपको लिंक करते हैं, और वे साइटें जिन पर वे पेज रहते हैं।
हाल-ताज़गी और पुनरावृत्ति के हिसाब से भार दें
एक referrer जो इस हफ़्ते पचास बार दिखा वह उससे ऊपर रहता है जो पिछली तिमाही में एक बार दिखा। हर candidate को इस आधार पर भार दें कि वह कितनी बार दोहराता है और आख़िरी बार कितने हाल ही में उस पर चला गया। हाल-ताज़गी अहम आधा हिस्सा है: अभी crawl हो रहा पेज अभी चलन में मौजूद पेज है।
अपने ही पेजों पर आने वाले LLM crawler से क्रॉस-रेफ़रेंस करें
समय को मिलाएँ। जब कोई PetalBot रेफ़रल आपके प्रोडक्ट पेज की ओर इशारा करता है, तो जाँचें कि क्या GPTBot, ClaudeBot या बाकियों ने उसी विंडो में उसी पेज को हिट किया। समय में ओवरलैप इस दावे को मज़बूत करता है कि वह थर्ड-पार्टी पेज उसका हिस्सा है जो AI इस समय आपके बारे में पढ़ रहा है।
इसे रैंक करें, और इसे एक शॉर्टलिस्ट की तरह लें
जो निकलता है वह थर्ड-पार्टी पेजों और डोमेन की एक रैंक की गई सूची है जो सबसे ज़्यादा संभावना से आपके ब्रांड के बारे में AI के जवाब खिला रहे हैं, जो पूरी तरह first-party data से बनी है। इसे जाँचने के लिए एक लीड सूची की तरह लें, एक साबित citation सेट की तरह नहीं।
कदम 1 से 6 ठीक वही हैं जो WISLR.ai आपके लिए चलाता है। यह edge पर AI crawler और PetalBot गतिविधि कैप्चर करता है, referrer रखता है, और उन्हें उन थर्ड-पार्टी पेजों की एक रैंक की गई, हमेशा-ताज़ा फ़ीड में बदल देता है जो सबसे ज़्यादा संभावना से यह आकार दे रहे हैं कि AI आपके ब्रांड के बारे में क्या कहता है, जिसे आपकी अपनी साइट पर आने वाले LLM crawler से क्रॉस-रेफ़रेंस किया जाता है। किसी लॉग खींचतान की ज़रूरत नहीं।
What the Graph Is Good For
आपके बारे में बात करते पेजों की एक रैंक की गई फ़ीड, लगातार ताज़ा होती हुई, उपयोगी है चाहे AI-grounding परिकल्पना टिके या न टिके।
गलत जानकारी को स्रोत पर सुधारें। अगर आपकी रेफ़रल फ़ीड में कोई पेज आपके ब्रांड के बारे में कुछ गलत कह रहा है, और उसे इतनी बार crawl किया जा रहा है कि वह दिखने लगे, तो अब आप ठीक-ठीक जानते हैं कि कहाँ जवाब देना है। आप अब अंदाज़ा नहीं लगा रहे कि हज़ार साइटों में से कौन सी मायने रखती है। crawler ने आपको बता दिया कि कौन सी चलन में हैं।
उन ज़िक्रों को खोजें जिनके होने का आपको पता नहीं था। ज़्यादातर ब्रांड मॉनिटरिंग एक ऐसी सूची पर नज़र रखती है जो आपने बनाई। यह उस सूची पर नज़र रखती है जो वेब ने बनाई, और आपको वे रिव्यू, थ्रेड और तुलना वाले पेज सौंपती है जिन्हें आप कभी ट्रैक नहीं कर रहे थे, सीधे आपके अपने access logs से।
What We Are Assuming, and What We Cannot See
इस तरीके के नीचे दो धारणाएँ बैठी हैं, और इनमें से कोई पुष्ट नहीं है। इसे फिर भी इस्तेमाल करना सार्थक है, पर सिर्फ़ तभी जब आप जानते हों कि यह कहाँ रुकता है।
हम PetalBot का रास्ता देख सकते हैं। हम OpenAI का नहीं देख सकते। ओवरलैप एक वाजिब दांव है, क्योंकि दोनों उस खुले वेब को crawl करते हैं जहाँ ब्रांड के ज़िक्र रहते हैं, पर यह एक दांव है। PetalBot के कुछ referrer ऐसे पेज होंगे जिन्हें कोई AI crawler कभी नहीं पढ़ता, और कुछ पेज जिन्हें AI पढ़ता है वे PetalBot के ट्रेल में कभी नहीं दिखेंगे।
शायद किया जाए। शायद यह बजाय इसके training को खिलाए। शायद यह कुछ ऐसा खिलाए जिसे हमने नाम नहीं दिया। लॉग डेटा हमें यह नहीं बता सकता कि कौन सा, और जो कोई आपको कहता है कि यह बता सकता है, वह सबूत की इजाज़त से ज़्यादा आत्मविश्वास के साथ अंदाज़ा लगा रहा है। लॉग जो साबित करते हैं वह संकीर्ण और असली है: एक थर्ड-पार्टी पेज ने आपको लिंक किया, और एक crawler ने उसे फॉलो किया।
यह AI citations का माप नहीं है। यह उनका एक first-party प्रॉक्सी है, जो उस डेटा से सस्ते में बना है जो आप पहले से इकट्ठा करते हैं। हमने क्लाइंट्स के लिए ठीक यही बनाया है: थर्ड-पार्टी citation candidate का एक first-party डेटासेट, उनके अपने लॉग से निकाला हुआ। जो अटकल है वह वह लेबल है जो हम ग्राफ़ पर लगाते हैं, ग्राफ़ खुद नहीं।
हम आपके अपने लॉग से आपकी citation-candidate फ़ीड बना सकते हैं।
WISLR आपके first-party data पर, प्रति URL और प्रति दिन, edge पर AI crawler व्यवहार पढ़ता है। इसमें PetalBot के रेफ़रल ट्रेल को उन थर्ड-पार्टी पेजों की एक रैंक की गई फ़ीड में खींचना शामिल है जो सबसे ज़्यादा संभावना से यह आकार दे रहे हैं कि AI आपके ब्रांड के बारे में क्या कहता है, और इसे आपकी साइट पर आने वाले LLM crawler से क्रॉस-रेफ़रेंस करना।