रोबोट्स.txt परीक्षक
एक robots.txt फ़ाइल चिपकाएँ, एक क्रॉलर चुनें - जिसमें GPTBot, क्लाउडबॉट और Google-एक्सटेंडेड शामिल हैं - और तुरंत देखें कि क्या यह किसी दिए गए URL पथ को सटीक नियम और लाइन नंबर के साथ ला सकता है जिसने इसे तय किया है।
नतीजा
एक robots.txt फ़ाइल पढ़ने में भ्रामक रूप से सरल है और गलत होने में आश्चर्यजनक रूप से आसान है: गलत उपयोगकर्ता-एजेंट समूह के तहत एक आवारा `अस्वीकृत: /` पूरी साइट को चुपचाप डी-इंडेक्स कर सकता है, जबकि एक नियम जो ऐसा लगता है कि यह एक क्रॉलर को ब्लॉक करता है उसे फ़ाइल में कहीं और लंबे, अधिक विशिष्ट पैटर्न द्वारा ओवरराइड किया जा सकता है। यह टूल खोज इंजन और एआई क्रॉलर द्वारा उपयोग किए जाने वाले वास्तविक मिलान एल्गोरिदम को फिर से कार्यान्वित करता है - वास्तविक रोबोट बहिष्करण प्रोटोकॉल को आरएफसी 9309 में औपचारिक रूप दिया गया है और Google द्वारा प्रलेखित किया गया है - इसे सरल लाइन-बाय-लाइन स्कैन के साथ अनुमानित करने के बजाय, इसलिए जो निर्णय आप यहां देख रहे हैं वह वही निर्णय है जो एक वास्तविक क्रॉलर गणना करेगा।
अपनी robots.txt सामग्री चिपकाएँ, वह URL पथ टाइप करें जिसे आप जाँचना चाहते हैं (जैसे `/admin/` या `/blog/draft-post`), और 20 वास्तविक उपयोगकर्ता-एजेंट टोकन की बंडल सूची से एक क्रॉलर चुनें। वह सूची जानबूझकर क्लासिक्स से आगे जाती है - Googlebot, Bingbot, और `*` फ़ॉलबैक - AI स्क्रैपर्स की वर्तमान पीढ़ी को शामिल करने के लिए: GPTBot और OAI-SearchBot (OpenAI), क्लाउडबॉट और एंथ्रोपिक-एआई (एंथ्रोपिक), Google-एक्सटेंडेड (Google का AI-प्रशिक्षण ऑप्ट-आउट सिग्नल, Googlebot के सर्च क्रॉलर से अलग), Applebot-एक्सटेंडेड (Apple के समकक्ष ऑप्ट-आउट), PerplexityBot, सीसीबीओटी (कॉमन क्रॉल, जिसका संग्रह कई अन्य एआई मॉडल को फीड करता है), बाइटस्पाइडर (बाइटडांस), मेटा-एक्सटर्नलएजेंट, अमेज़ॅनबॉट और बहुत कुछ। प्रत्येक टोकन एक संक्षिप्त, ईमानदार व्याख्या के साथ भेजा जाता है कि यह वास्तव में क्या है।
एल्गोरिथ्म स्वयं विनिर्देश का सटीक रूप से पालन करता है: उपयोगकर्ता-एजेंट समूहों को केस-असंवेदनशील रूप से मिलान किया जाता है, उत्पाद टोकन पर एक सटीक या उपसर्ग मिलान हमेशा `*` फ़ॉलबैक समूह को हराता है, और एक ही टोकन घोषित करने वाले कई ब्लॉक वास्तविक क्रॉलर के रूप में विलय कर दिए जाते हैं। विजेता समूह के भीतर, प्रत्येक अनुमति और अस्वीकृत नियम को उचित वाइल्डकार्ड शब्दार्थ (`*` किसी भी अनुक्रम से मेल खाता है, पथ के अंत में एक अनुगामी `$` एंकर) का उपयोग करके पथ के विरुद्ध जांचा जाता है, और सबसे लंबा मिलान पैटर्न जीतता है - समान लंबाई के अस्वीकृत के खिलाफ किसी भी टाई को जीतने की अनुमति के साथ, बिल्कुल Google के स्वयं के robots.txt कार्यान्वयन द्वारा प्रलेखित।
परिणाम पैनल केवल अनुमति या अवरुद्ध नहीं कहता है - यह सटीक पंक्ति और नियम पाठ को जिम्मेदार बताता है, ताकि आप सीधे अपनी फ़ाइल पर वापस जा सकें और जो निर्देश मायने रखता है उसे ठीक (या पुष्टि) कर सकें। यह वह विवरण है जिसे अधिकांश robots.txt चेकर्स छोड़ देते हैं, और यह अनुमान लगाने के बीच का अंतर है कि किसी पृष्ठ को क्रॉल क्यों नहीं किया जा रहा है और यह निश्चित रूप से जानने के बीच का अंतर है।