0

रोबोट्स.txt परीक्षक

एक robots.txt फ़ाइल चिपकाएँ, एक क्रॉलर चुनें - जिसमें GPTBot, क्लाउडबॉट और Google-एक्सटेंडेड शामिल हैं - और तुरंत देखें कि क्या यह किसी दिए गए URL पथ को सटीक नियम और लाइन नंबर के साथ ला सकता है जिसने इसे तय किया है।

Buy Me a Coffee at ko-fi.com
प्रसंस्करण... 0%
robots.txt को पार्स करना
क्रॉलर नियमों का मिलान
हो गया

नतीजा

एक robots.txt फ़ाइल पढ़ने में भ्रामक रूप से सरल है और गलत होने में आश्चर्यजनक रूप से आसान है: गलत उपयोगकर्ता-एजेंट समूह के तहत एक आवारा `अस्वीकृत: /` पूरी साइट को चुपचाप डी-इंडेक्स कर सकता है, जबकि एक नियम जो ऐसा लगता है कि यह एक क्रॉलर को ब्लॉक करता है उसे फ़ाइल में कहीं और लंबे, अधिक विशिष्ट पैटर्न द्वारा ओवरराइड किया जा सकता है। यह टूल खोज इंजन और एआई क्रॉलर द्वारा उपयोग किए जाने वाले वास्तविक मिलान एल्गोरिदम को फिर से कार्यान्वित करता है - वास्तविक रोबोट बहिष्करण प्रोटोकॉल को आरएफसी 9309 में औपचारिक रूप दिया गया है और Google द्वारा प्रलेखित किया गया है - इसे सरल लाइन-बाय-लाइन स्कैन के साथ अनुमानित करने के बजाय, इसलिए जो निर्णय आप यहां देख रहे हैं वह वही निर्णय है जो एक वास्तविक क्रॉलर गणना करेगा।

अपनी robots.txt सामग्री चिपकाएँ, वह URL पथ टाइप करें जिसे आप जाँचना चाहते हैं (जैसे `/admin/` या `/blog/draft-post`), और 20 वास्तविक उपयोगकर्ता-एजेंट टोकन की बंडल सूची से एक क्रॉलर चुनें। वह सूची जानबूझकर क्लासिक्स से आगे जाती है - Googlebot, Bingbot, और `*` फ़ॉलबैक - AI स्क्रैपर्स की वर्तमान पीढ़ी को शामिल करने के लिए: GPTBot और OAI-SearchBot (OpenAI), क्लाउडबॉट और एंथ्रोपिक-एआई (एंथ्रोपिक), Google-एक्सटेंडेड (Google का AI-प्रशिक्षण ऑप्ट-आउट सिग्नल, Googlebot के सर्च क्रॉलर से अलग), Applebot-एक्सटेंडेड (Apple के समकक्ष ऑप्ट-आउट), PerplexityBot, सीसीबीओटी (कॉमन क्रॉल, जिसका संग्रह कई अन्य एआई मॉडल को फीड करता है), बाइटस्पाइडर (बाइटडांस), मेटा-एक्सटर्नलएजेंट, अमेज़ॅनबॉट और बहुत कुछ। प्रत्येक टोकन एक संक्षिप्त, ईमानदार व्याख्या के साथ भेजा जाता है कि यह वास्तव में क्या है।

एल्गोरिथ्म स्वयं विनिर्देश का सटीक रूप से पालन करता है: उपयोगकर्ता-एजेंट समूहों को केस-असंवेदनशील रूप से मिलान किया जाता है, उत्पाद टोकन पर एक सटीक या उपसर्ग मिलान हमेशा `*` फ़ॉलबैक समूह को हराता है, और एक ही टोकन घोषित करने वाले कई ब्लॉक वास्तविक क्रॉलर के रूप में विलय कर दिए जाते हैं। विजेता समूह के भीतर, प्रत्येक अनुमति और अस्वीकृत नियम को उचित वाइल्डकार्ड शब्दार्थ (`*` किसी भी अनुक्रम से मेल खाता है, पथ के अंत में एक अनुगामी `$` एंकर) का उपयोग करके पथ के विरुद्ध जांचा जाता है, और सबसे लंबा मिलान पैटर्न जीतता है - समान लंबाई के अस्वीकृत के खिलाफ किसी भी टाई को जीतने की अनुमति के साथ, बिल्कुल Google के स्वयं के robots.txt कार्यान्वयन द्वारा प्रलेखित।

परिणाम पैनल केवल अनुमति या अवरुद्ध नहीं कहता है - यह सटीक पंक्ति और नियम पाठ को जिम्मेदार बताता है, ताकि आप सीधे अपनी फ़ाइल पर वापस जा सकें और जो निर्देश मायने रखता है उसे ठीक (या पुष्टि) कर सकें। यह वह विवरण है जिसे अधिकांश robots.txt चेकर्स छोड़ देते हैं, और यह अनुमान लगाने के बीच का अंतर है कि किसी पृष्ठ को क्रॉल क्यों नहीं किया जा रहा है और यह निश्चित रूप से जानने के बीच का अंतर है।