Skip to main content

आपके सर्वर लॉग उन थर्ड-पार्टी पेजों के नाम बताते हैं जो AI को आपके ब्रांड के बारे में सिखा रहे हैं।

जब ChatGPT जैसे AI टूल आपके ब्रांड के बारे में सीखते हैं, तो वे अक्सर उन दूसरी वेबसाइटों से शुरुआत करते हैं जो आपका ज़िक्र करती हैं: रिव्यू, फोरम थ्रेड, तुलना वाले लेख। हर बार जब कोई AI crawler उनमें से किसी पेज से आपके पेज तक लिंक फॉलो करता है, तो आपका सर्वर उसे दर्ज कर लेता है। पेच यह है कि ज़्यादातर AI crawler यह नहीं बताते कि वे किस पेज से आए। एक crawler, PetalBot, बताता है। यह हर बार वही बाहरी पेज रिपोर्ट करता है जिसने आपको लिंक किया था। इससे आपको एक चलती-फिरती सूची मिलती है, जो उन्हीं रिकॉर्ड से बनी है जो आप पहले से रखते हैं, उन पेजों की जो सबसे ज़्यादा संभावना से यह आकार दे रहे हैं कि AI आपके ब्रांड के बारे में क्या कहता है। यह गाइड बताती है कि यह कैसे काम करता है, इस सूची को खुद कैसे बनाएं, और यह क्या साबित कर सकती है और क्या नहीं।

Crawler फोरेंसिक: PetalBot उन थर्ड-पार्टी पेजों को उजागर करता है जो सबसे ज़्यादा संभावना से आपके ब्रांड के बारे में AI citations खिला रहे हैं
यह परिकल्पना
  1. AI crawlers reach you by following backlinks, and that leaves a footprint. GPTBot and others do not only crawl your sitemap. They also arrive by following a link from a third-party page that mentions your brand: a forum thread, a comparison article, a review. That link-following happens in real time and lands in your server logs, timestamped and fresh.
  2. Most crawlers hide where they came from. PetalBot does not. Nearly every LLM crawler fetches your pages without saying which page sent it. PetalBot does the opposite: it reports the exact referring URL on its hits. That single behavior turns a log line into a source citation.
  3. PetalBot and the LLM crawlers largely read the same web. So when PetalBot hands you a referring URL, it is pointing at a page the AI crawlers are plausibly reading too. Pull those URLs and you have a first-party shortlist of the third-party pages most likely shaping what AI says about your brand.
  4. The overlap with AI crawlers is inferred, not confirmed. We can see PetalBot's path. We cannot see OpenAI's. Whether this data feeds citation grounding or model training is something the logs cannot tell us either. The method is useful anyway, and its limits are spelled out below.

एक crawler-फोरेंसिक परिकल्पना। आपके सर्वर लॉग में पहले से उन थर्ड-पार्टी पेजों की एक मोटी सूची मौजूद है जो सबसे ज़्यादा संभावना से यह खिला रहे हैं कि AI आपके ब्रांड के बारे में क्या कहता है। आप लगभग निश्चित रूप से यह डेटा इकट्ठा कर रहे हैं और यह संकेत फेंक रहे हैं।

ज़्यादातर लोग AI crawler की कल्पना उसी तरह करते हैं जैसे वे Googlebot की करते हैं: यह आपका sitemap पढ़ता है, आपके आंतरिक लिंक पर चलता है, और आपके पेज indexing करता है। ऐसा होता है। पर GPTBot और बाकी आप तक पहुँचने का यही इकलौता रास्ता नहीं है।

वे एक backlink फॉलो करके भी आते हैं: एक फोरम थ्रेड जो आपकी तुलना किसी प्रतिस्पर्धी से करता है, किसी ऐसी साइट पर एक रिव्यू जिसका नाम आपने कभी सुना नहीं, एक राउंडअप लेख जो आपके प्रोडक्ट पेज को लिंक करता है। जब कोई AI crawler उनमें से किसी लिंक को फॉलो करता है, तो यह लगभग रियल टाइम के करीब होता है और एक timestamp के साथ आपके access logs में उतरता है।

हर लिंक-फॉलो एक ऐसा तथ्य दर्ज करता है जिस पर आप कार्रवाई कर सकते हैं। एक थर्ड-पार्टी पेज ने आपका ज़िक्र किया, और एक crawler आप तक पहुँचने के लिए उस लिंक पर चला।

यह पता लगाने का आम तरीका कि कौन से थर्ड-पार्टी पेज AI के जवाब आकार दे रहे हैं, यह है कि ChatGPT, Perplexity और बाकियों को प्रॉम्प्ट किया जाए और उनके लौटाए JSON में से स्रोत निकाल लिए जाएँ। यह काम करता है, और आपको यह करना चाहिए। पर यह समस्या को बाहर से देखता है, एक बार में एक प्रॉम्प्ट। आपके अपने लॉग आपको अंदर से देखने देते हैं, लगातार, ऐसे डेटा पर जिसे कोई रेट-लिमिट या छीन नहीं सकता।

Most Crawlers Will Not Tell You Where They Came From

एक backlink-फॉलो तभी उपयोगी है जब crawler आपको बताए कि उसने कौन सा पेज फॉलो किया, और वह एक ही जगह रहता है: Referer header में जो crawler अपने अनुरोध के साथ भेजता है।

LLM crawler में से लगभग कोई इसे नहीं भेजता। वे आपका पेज फ़ेच करते हैं और इस बारे में कुछ भी दर्ज नहीं करते कि वे कहाँ से आए। आप विज़िट देखते हैं। आप स्रोत नहीं देखते।

Crawlerरेफ़र करने वाला पेज रिपोर्ट करता है?
GPTBotकोई referrer रिपोर्ट नहीं
ClaudeBotकोई referrer रिपोर्ट नहीं
PerplexityBotकोई referrer रिपोर्ट नहीं
Bingbotकोई referrer रिपोर्ट नहीं
PetalBotपूरा referring URL रिपोर्ट करता है

तो जिस crawl की आपको परवाह है उसका ज़्यादातर हिस्सा स्रोत पर गुमनाम है। आप साबित कर सकते हैं कि एक AI बॉट ने विज़िट किया। आप यह साबित नहीं कर सकते कि उसे किसने भेजा। एक crawler उस खाई को पाटता है।

PetalBot Is the Exception

PetalBot, Huawei के Petal Search के पीछे का crawler है। यह किसी AI लैब का बॉट नहीं है। पर यह एक काम करता है जो लगभग और कोई नहीं करता: अपने अनुरोधों पर, यह referring URL रिपोर्ट करता है। ठीक वही थर्ड-पार्टी पेज जिसे फॉलो करके यह आपके पेज तक पहुँचा, query string समेत सब कुछ।

हमारे लॉग में, यह व्यवहार कभी-कभार का नहीं है। यह नियम है।

100%
जिन PetalBot हिट्स की हमने जाँच की उनमें पूरा citing URL मौजूद था
Query strings बरकरार
referrer पूरे आते हैं, महज़ डोमेन तक छाँटे हुए नहीं

PetalBot की एक लॉग लाइन उस खाई को पाट देती है। एक सामान्य AI-crawler हिट आपको बताती है कि एक बॉट आया। एक PetalBot हिट आपको बताती है कि एक बॉट आया और उस पेज का नाम बताती है जिसने उसे भेजा।

एक अकेले PetalBot अनुरोध पर टिप्पणी
203.0.113.x - - [20/Jul/2026:14:22:07 +0000] "GET /products/widget-pro HTTP/1.1" 200 18244 "https://forum.example.com/thread/best-widgets-2026?sort=top" "PetalBot"
Referrerवह थर्ड-पार्टी पेज जिसे PetalBot ने आप तक पहुँचने के लिए फॉलो किया। यही citation candidate है। query string सुरक्षित रहती है, इसलिए आप ठीक उसी दृश्य पर उतरते हैं, किसी अंदाज़े पर नहीं।
Timestampजब लिंक पर चला गया। पुराने referrer से ताज़ा referrer ज़्यादा मायने रखते हैं: आज crawl हो रहा पेज आज चलन में मौजूद पेज है।
लक्ष्यआपके किस पेज को थर्ड-पार्टी साइट ने लिंक किया। यह आपको बताता है कि आपके ब्रांड के बारे में और कहाँ क्या चर्चा हो रही है।

हम PetalBot को उन अधिक शिष्ट crawler में भी गिनते हैं जो हम देखते हैं, जिसे हमारे लॉग में प्रति मिनट चरम अनुरोधों से मापा गया है। यह आपके origin को हथौड़े नहीं मार रहा। इसे छोड़ देने की परिचालन लागत बहुत कम है, और इसे ब्लॉक करने की एक असली संकेत-लागत है।

PetalBot को ब्लॉक न करें। इसे ब्लॉक करना वह इकलौती चाल है जो इस पूरे संकेत को फेंक देती है।

PetalBot and the LLM Crawlers Read the Same Web

अगला कदम वह है जहाँ यह तरीका अवलोकन होना बंद कर देता है और अनुमान बन जाता है।

PetalBot और LLM crawler काफ़ी हद तक एक ही वेब पढ़ रहे हैं। वे एक ही लिंक फॉलो करते हैं, उन्हीं रिव्यू साइटों और फोरमों और तुलना वाले लेखों से, क्योंकि आपके ब्रांड के ज़िक्र वहीं रहते हैं। तो जब PetalBot आपको एक referring URL सौंपता है, तो वह एक ऐसे पेज की ओर इशारा कर रहा है जिसे AI crawler भी संभावित रूप से पढ़ रहे हैं।

PetalBot अपना referrer रिपोर्ट करता है और LLM crawler नहीं करते। जो यह रिपोर्ट करता है उसे उसके विकल्प के तौर पर इस्तेमाल करें जो वे छुपाते हैं।

थर्ड-पार्टी पेज
एक रिव्यू, फोरम थ्रेड या तुलना वाला लेख जो आपके ब्रांड का ज़िक्र करता है और आपको लिंक करता है।
PetalBot लिंक फॉलो करता है
और आपके access log में referring URL दर्ज करता है, timestamp के साथ और पूरा।
LLM crawler संभावित रूप से इसे भी फॉलो करते हैं
उसी वजह से वही पेज पढ़ते हुए। यह कदम अनुमानित है, अवलोकित नहीं।

यह तकनीक त्रिकोणीयकरण है। आप लक्ष्य को सीधे नहीं देख सकते, इसलिए आप कोई ऐसी चीज़ मापते हैं जो उसके साथ चलती है। यहाँ, मापने योग्य चीज़ PetalBot का रेफ़रल ट्रेल है, जो एक ऐसी लॉग फ़ाइल में बैठा है जो पहले से आपकी अपनी है।

Build the Graph: From Raw Logs to a Citation Shortlist

इसमें से किसी के लिए किसी नए टूल की ज़रूरत नहीं। इसके लिए वे लॉग चाहिए जो आप पहले से इकट्ठा करते हैं और कुछ फ़िल्टरिंग कदम।

1

Edge पर लॉग करें, और Referer header रखें

अनुरोधों को सर्वर या CDN पर कैप्चर करें, किसी JavaScript टैग में नहीं, क्योंकि crawler टैग नहीं चलाते। यह पूरा तरीका जिस एक फ़ील्ड पर निर्भर है वह है Referer। अगर आपकी लॉगिंग इसे छाँट देती है, या query strings छोटा कर देती है, तो पहले उसे ठीक करें। जो header आपने कभी संग्रहीत ही नहीं किया उसे आप वापस नहीं पा सकते।

2

उन PetalBot हिट्स तक फ़िल्टर करें जो कोई थर्ड-पार्टी referrer साथ लाती हैं

PetalBot के user-agent का मिलान करें, फिर सिर्फ़ वे हिट्स रखें जिनका referrer किसी ऐसे डोमेन की ओर इशारा करता है जो आपका नहीं है। वे बाहरी referrer आपके citation candidate हैं। खुद-की-ओर रेफ़रल और खाली referrer हटा दें; इस मकसद के लिए वे शोर हैं।

3

पेजों तक डीडुप्लिकेट करें, फिर डोमेन तक समेटें

वही फोरम थ्रेड कई बार दिखाई देगा। दोहराए गए URL को अलग-अलग पेजों में समेटें, फिर पेजों को उनके डोमेन के तहत समूहित करें। अब आपके पास दो दृश्य हैं: वे अलग-अलग पेज जो आपको लिंक करते हैं, और वे साइटें जिन पर वे पेज रहते हैं।

4

हाल-ताज़गी और पुनरावृत्ति के हिसाब से भार दें

एक referrer जो इस हफ़्ते पचास बार दिखा वह उससे ऊपर रहता है जो पिछली तिमाही में एक बार दिखा। हर candidate को इस आधार पर भार दें कि वह कितनी बार दोहराता है और आख़िरी बार कितने हाल ही में उस पर चला गया। हाल-ताज़गी अहम आधा हिस्सा है: अभी crawl हो रहा पेज अभी चलन में मौजूद पेज है।

5

अपने ही पेजों पर आने वाले LLM crawler से क्रॉस-रेफ़रेंस करें

समय को मिलाएँ। जब कोई PetalBot रेफ़रल आपके प्रोडक्ट पेज की ओर इशारा करता है, तो जाँचें कि क्या GPTBot, ClaudeBot या बाकियों ने उसी विंडो में उसी पेज को हिट किया। समय में ओवरलैप इस दावे को मज़बूत करता है कि वह थर्ड-पार्टी पेज उसका हिस्सा है जो AI इस समय आपके बारे में पढ़ रहा है।

6

इसे रैंक करें, और इसे एक शॉर्टलिस्ट की तरह लें

जो निकलता है वह थर्ड-पार्टी पेजों और डोमेन की एक रैंक की गई सूची है जो सबसे ज़्यादा संभावना से आपके ब्रांड के बारे में AI के जवाब खिला रहे हैं, जो पूरी तरह first-party data से बनी है। इसे जाँचने के लिए एक लीड सूची की तरह लें, एक साबित citation सेट की तरह नहीं।

या पाइपलाइन छोड़ दें

कदम 1 से 6 ठीक वही हैं जो WISLR.ai आपके लिए चलाता है। यह edge पर AI crawler और PetalBot गतिविधि कैप्चर करता है, referrer रखता है, और उन्हें उन थर्ड-पार्टी पेजों की एक रैंक की गई, हमेशा-ताज़ा फ़ीड में बदल देता है जो सबसे ज़्यादा संभावना से यह आकार दे रहे हैं कि AI आपके ब्रांड के बारे में क्या कहता है, जिसे आपकी अपनी साइट पर आने वाले LLM crawler से क्रॉस-रेफ़रेंस किया जाता है। किसी लॉग खींचतान की ज़रूरत नहीं।

Build it with WISLR.ai →

What the Graph Is Good For

आपके बारे में बात करते पेजों की एक रैंक की गई फ़ीड, लगातार ताज़ा होती हुई, उपयोगी है चाहे AI-grounding परिकल्पना टिके या न टिके।

गलत जानकारी को स्रोत पर सुधारें। अगर आपकी रेफ़रल फ़ीड में कोई पेज आपके ब्रांड के बारे में कुछ गलत कह रहा है, और उसे इतनी बार crawl किया जा रहा है कि वह दिखने लगे, तो अब आप ठीक-ठीक जानते हैं कि कहाँ जवाब देना है। आप अब अंदाज़ा नहीं लगा रहे कि हज़ार साइटों में से कौन सी मायने रखती है। crawler ने आपको बता दिया कि कौन सी चलन में हैं।

उन ज़िक्रों को खोजें जिनके होने का आपको पता नहीं था। ज़्यादातर ब्रांड मॉनिटरिंग एक ऐसी सूची पर नज़र रखती है जो आपने बनाई। यह उस सूची पर नज़र रखती है जो वेब ने बनाई, और आपको वे रिव्यू, थ्रेड और तुलना वाले पेज सौंपती है जिन्हें आप कभी ट्रैक नहीं कर रहे थे, सीधे आपके अपने access logs से।

अगर AI-grounding परिकल्पना कभी नहीं टिकती, तब भी आपके पास एक ब्रांड-मॉनिटरिंग फ़ीड है जो उस डेटा से बनी है जो आप पहले से इकट्ठा करते हैं। अगर यह टिकती है, तो आपके पास एक नक्शा है कि AI आपके बारे में कहाँ सीख रहा है।

What We Are Assuming, and What We Cannot See

इस तरीके के नीचे दो धारणाएँ बैठी हैं, और इनमें से कोई पुष्ट नहीं है। इसे फिर भी इस्तेमाल करना सार्थक है, पर सिर्फ़ तभी जब आप जानते हों कि यह कहाँ रुकता है।

हम मानते हैं कि PetalBot और LLM crawler एक ही लिंक फॉलो करते हैं।

हम PetalBot का रास्ता देख सकते हैं। हम OpenAI का नहीं देख सकते। ओवरलैप एक वाजिब दांव है, क्योंकि दोनों उस खुले वेब को crawl करते हैं जहाँ ब्रांड के ज़िक्र रहते हैं, पर यह एक दांव है। PetalBot के कुछ referrer ऐसे पेज होंगे जिन्हें कोई AI crawler कभी नहीं पढ़ता, और कुछ पेज जिन्हें AI पढ़ता है वे PetalBot के ट्रेल में कभी नहीं दिखेंगे।

हम मानते हैं कि इस डेटा का इस्तेमाल citation grounding के लिए किया जाएगा।

शायद किया जाए। शायद यह बजाय इसके training को खिलाए। शायद यह कुछ ऐसा खिलाए जिसे हमने नाम नहीं दिया। लॉग डेटा हमें यह नहीं बता सकता कि कौन सा, और जो कोई आपको कहता है कि यह बता सकता है, वह सबूत की इजाज़त से ज़्यादा आत्मविश्वास के साथ अंदाज़ा लगा रहा है। लॉग जो साबित करते हैं वह संकीर्ण और असली है: एक थर्ड-पार्टी पेज ने आपको लिंक किया, और एक crawler ने उसे फॉलो किया।

यह AI citations का माप नहीं है। यह उनका एक first-party प्रॉक्सी है, जो उस डेटा से सस्ते में बना है जो आप पहले से इकट्ठा करते हैं। हमने क्लाइंट्स के लिए ठीक यही बनाया है: थर्ड-पार्टी citation candidate का एक first-party डेटासेट, उनके अपने लॉग से निकाला हुआ। जो अटकल है वह वह लेबल है जो हम ग्राफ़ पर लगाते हैं, ग्राफ़ खुद नहीं।

WISLR के साथ काम करें

हम आपके अपने लॉग से आपकी citation-candidate फ़ीड बना सकते हैं।

WISLR आपके first-party data पर, प्रति URL और प्रति दिन, edge पर AI crawler व्यवहार पढ़ता है। इसमें PetalBot के रेफ़रल ट्रेल को उन थर्ड-पार्टी पेजों की एक रैंक की गई फ़ीड में खींचना शामिल है जो सबसे ज़्यादा संभावना से यह आकार दे रहे हैं कि AI आपके ब्रांड के बारे में क्या कहता है, और इसे आपकी साइट पर आने वाले LLM crawler से क्रॉस-रेफ़रेंस करना।

See how AI Channel Analytics measures it →