0

Robots.txt Tester

Επικολλήστε ένα αρχείο robots.txt, επιλέξτε ένα πρόγραμμα ανίχνευσης — συμπεριλαμβανομένων των GPTBot, ClaudeBot και Google-Extended — και δείτε αμέσως εάν μπορεί να ανακτήσει μια δεδομένη διαδρομή URL, με τον ακριβή κανόνα και τον αριθμό γραμμής που το αποφάσισε.

Buy Me a Coffee at ko-fi.com
Επεξεργασία... 0%
Ανάλυση robots.txt
Αντιστοίχιση κανόνων ανίχνευσης
Έγινε

Αποτέλεσμα

Ένα αρχείο robots.txt είναι παραπλανητικά απλό στην ανάγνωση και εκπληκτικά εύκολο να γίνει λάθος: μια αδέσποτη "Απαγόρευση: /" κάτω από τη λάθος ομάδα παράγοντα χρήστη μπορεί σιωπηλά να καταργήσει το ευρετήριο ενός ολόκληρου ιστότοπου, ενώ ένας κανόνας που μοιάζει να αποκλείει έναν ανιχνευτή μπορεί να παρακαμφθεί από ένα μεγαλύτερο, πιο συγκεκριμένο μοτίβο σε άλλο σημείο του αρχείου. Αυτό το εργαλείο επαναλαμβάνει τον πραγματικό αλγόριθμο αντιστοίχισης που χρησιμοποιούν οι μηχανές αναζήτησης και οι ανιχνευτές τεχνητής νοημοσύνης - το de-facto πρωτόκολλο εξαίρεσης ρομπότ που επισημοποιήθηκε στο RFC 9309 και τεκμηριώθηκε από την Google - αντί να το προσεγγίζει με μια απλή σάρωση γραμμή προς γραμμή, οπότε η ετυμηγορία που βλέπετε εδώ είναι η ετυμηγορία που θα υπολόγιζε ένας πραγματικός ανιχνευτής.

Επικολλήστε το περιεχόμενό σας στο robots.txt, πληκτρολογήστε τη διαδρομή URL που θέλετε να ελέγξετε (όπως `/admin/` ή `/blog/draft-post`) και επιλέξτε ένα πρόγραμμα ανίχνευσης από μια ομαδοποιημένη λίστα 20 πραγματικών διακριτικών παραγόντων χρήστη. Αυτή η λίστα ξεπερνά σκόπιμα τα κλασικά — Googlebot, Bingbot και το εναλλακτικό «*» — για να συμπεριλάβει την τρέχουσα γενιά ξύστρων τεχνητής νοημοσύνης: GPTBot και OAI-SearchBot (OpenAI), ClaudeBot and anthropic-ai (Anthropic), Google-Extended (Google's AI-training, ξεχωριστή αναζήτησης AI-E-εκπαίδευσης από το Google-Eppleertxbotal» (Ισοδύναμο opt-out της Apple), PerplexityBot, CCBot (Common Crawl, του οποίου το αρχείο τροφοδοτεί πολλά άλλα μοντέλα AI), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot και άλλα. Κάθε μάρκα συνοδεύεται από μια σύντομη, ειλικρινή εξήγηση του τι είναι στην πραγματικότητα.

Ο ίδιος ο αλγόριθμος ακολουθεί με ακρίβεια την προδιαγραφή: οι ομάδες χρήστη-πρακτόρων αντιστοιχίζονται χωρίς διάκριση πεζών-κεφαλαίων, με μια ακριβή αντιστοίχιση ή αντιστοίχιση προθέματος στο διακριτικό προϊόντος να ξεπερνά πάντα την εναλλακτική ομάδα «*» και πολλά μπλοκ που δηλώνουν το ίδιο διακριτικό συγχωνεύονται όπως κάνουν οι πραγματικοί ανιχνευτές. Εντός της νικητήριας ομάδας, κάθε κανόνας Allow and Disallow ελέγχεται στη διαδρομή χρησιμοποιώντας την κατάλληλη σημασιολογία χαρακτήρων μπαλαντέρ (το `*` αντιστοιχεί σε οποιαδήποτε ακολουθία, ένα τελευταίο `$` αγκυρώνει στο τέλος της διαδρομής) και κερδίζει το μεγαλύτερο μοτίβο αντιστοίχισης — με το Allow να κερδίζει οποιαδήποτε ισοπαλία έναντι ενός Disallow ίσου μήκους, ακριβώς όπως τεκμηριώνεται από τα ρομπότ υλοποίησης της Google.

Ο πίνακας αποτελεσμάτων δεν λέει απλώς ΕΠΙΤΡΕΠΟΜΕΝΟ ή ΑΠΟΚΛΕΙΣΜΕΝΟ — ονομάζει την ακριβή γραμμή και το κείμενο του κανόνα που είναι υπεύθυνο, ώστε να μπορείτε να επιστρέψετε κατευθείαν στο αρχείο σας και να διορθώσετε (ή να επιβεβαιώσετε) την οδηγία που έχει σημασία. Αυτή είναι η λεπτομέρεια που παραλείπουν τα περισσότερα πούλια του robots.txt και είναι η διαφορά μεταξύ του να μαντέψουμε γιατί δεν ανιχνεύεται μια σελίδα και να γνωρίζουμε με βεβαιότητα.