Ελεγκτής Robots.txt
Επικολλήστε ένα αρχείο robots.txt, επιλέξτε έναν crawler — συμπεριλαμβανομένων των GPTBot, ClaudeBot και Google-Extended — και δείτε αμέσως αν μπορεί να ανακτήσει μια δεδομένη διαδρομή URL, με τον ακριβή κανόνα και τον αριθμό γραμμής που το καθόρισε.
🔒 Επεξεργάζεται εξ ολοκλήρου στο πρόγραμμα περιήγησής σας — τίποτα που εισάγετε εδώ δεν μεταφορτώνεται ποτέ.
Αποτέλεσμα
Ένα αρχείο robots.txt είναι απατηλά απλό στην ανάγνωση και εκπληκτικά εύκολο να γίνει λάθος: ένα περιπλανώμενο `Disallow: /` κάτω από λάθος ομάδα User-agent μπορεί αθόρυβα να αφαιρέσει από την ευρετηρίαση έναν ολόκληρο ιστότοπο, ενώ ένας κανόνας που φαίνεται να αποκλείει έναν crawler μπορεί να παρακαμφθεί από ένα μακρύτερο, πιο συγκεκριμένο μοτίβο αλλού στο αρχείο. Αυτό το εργαλείο υλοποιεί εκ νέου τον πραγματικό αλγόριθμο αντιστοίχισης που χρησιμοποιούν οι μηχανές αναζήτησης και οι AI crawlers — το de-facto Robots Exclusion Protocol που επισημοποιήθηκε στο RFC 9309 και τεκμηριώθηκε από την Google — αντί να τον προσεγγίζει με μια απλή σάρωση γραμμή-γραμμή, οπότε το αποτέλεσμα που βλέπετε εδώ είναι το αποτέλεσμα που θα υπολόγιζε ένας πραγματικός crawler.
Επικολλήστε το περιεχόμενο του robots.txt σας, πληκτρολογήστε τη διαδρομή URL που θέλετε να ελέγξετε (όπως `/admin/` ή `/blog/draft-post`) και επιλέξτε έναν crawler από μια ενσωματωμένη λίστα 20 πραγματικών tokens user-agent. Αυτή η λίστα ξεπερνά σκόπιμα τα κλασικά — Googlebot, Bingbot και τη γενική χρήση `*` — για να συμπεριλάβει την τρέχουσα γενιά scrapers τεχνητής νοημοσύνης: GPTBot και OAI-SearchBot (OpenAI), ClaudeBot και anthropic-ai (Anthropic), Google-Extended (το σήμα εξαίρεσης εκπαίδευσης AI της Google, ξεχωριστά από τον crawler αναζήτησης Googlebot), Applebot-Extended (το αντίστοιχο σήμα εξαίρεσης της Apple), PerplexityBot, CCBot (Common Crawl, του οποίου το αρχείο τροφοδοτεί πολλά άλλα μοντέλα AI), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot και άλλα. Κάθε token συνοδεύεται από μια σύντομη, ειλικρινή επεξήγηση του τι πραγματικά είναι.
Ο ίδιος ο αλγόριθμος ακολουθεί την προδιαγραφή κατά γράμμα: οι ομάδες user-agent αντιστοιχίζονται χωρίς διάκριση πεζών-κεφαλαίων, με μια ακριβή αντιστοίχιση ή αντιστοίχιση προθέματος στο token προϊόντος να υπερισχύει πάντα της ομάδας γενικής χρήσης `*`, και πολλαπλά μπλοκ που δηλώνουν το ίδιο token συγχωνεύονται όπως κάνουν οι πραγματικοί crawlers. Εντός της επικρατούσας ομάδας, κάθε κανόνας Allow και Disallow ελέγχεται έναντι της διαδρομής χρησιμοποιώντας σωστή σημασιολογία μπαλαντέρ (το `*` αντιστοιχεί σε οποιαδήποτε ακολουθία, ένα τελικό `$` αγκυρώνει στο τέλος της διαδρομής) και το μακρύτερο μοτίβο που αντιστοιχεί κερδίζει — με ένα Allow να κερδίζει οποιαδήποτε ισοπαλία έναντι ενός Disallow ίσου μήκους, ακριβώς όπως τεκμηριώνεται από την ίδια την υλοποίηση του robots.txt της Google.
Το πλαίσιο αποτελέσματος δεν λέει απλώς ALLOWED ή BLOCKED — αναφέρει την ακριβή γραμμή και το κείμενο του κανόνα που ευθύνεται, ώστε να μπορείτε να πάτε κατευθείαν πίσω στο αρχείο σας και να διορθώσετε (ή να επιβεβαιώσετε) την οδηγία που έχει σημασία. Αυτή είναι η λεπτομέρεια που οι περισσότεροι ελεγκτές robots.txt παραλείπουν, και είναι η διαφορά μεταξύ του να μαντεύετε γιατί μια σελίδα δεν ανιχνεύεται και του να γνωρίζετε με βεβαιότητα.