0

Kiểm tra Robots.txt

Dán tệp robots.txt, chọn một crawler — bao gồm GPTBot, ClaudeBot và Google-Extended — và xem ngay liệu nó có thể truy xuất một đường dẫn URL nhất định không, cùng với quy tắc và số dòng quyết định kết quả.

🔒 Được xử lý hoàn toàn trong trình duyệt của bạn — không có nội dung nào bạn nhập ở đây được tải lên.

Đang xử lý... 0%
Đang phân tích cú pháp robots.txt
Đang khớp quy tắc crawler
Hoàn tất

Kết quả

Tệp robots.txt trông có vẻ đơn giản để đọc nhưng lại dễ mắc sai sót: một dòng `Disallow: /` không đúng nhóm User-agent có thể âm thầm hủy lập chỉ mục toàn bộ trang web, trong khi một quy tắc tưởng chặn crawler lại có thể bị ghi đè bởi một mẫu dài hơn, cụ thể hơn ở chỗ khác trong tệp. Công cụ này tái triển khai thuật toán khớp thực tế mà các công cụ tìm kiếm và trình thu thập AI sử dụng — giao thức Robots Exclusion Protocol trên thực tế được chuẩn hóa trong RFC 9309 và được Google ghi lại — thay vì chỉ xấp xỉ bằng cách quét từng dòng, vì vậy kết quả bạn thấy ở đây chính là kết quả mà một crawler thực sẽ tính toán ra.

Dán nội dung robots.txt của bạn, nhập đường dẫn URL bạn muốn kiểm tra (như `/admin/` hoặc `/blog/draft-post`), và chọn một crawler từ danh sách 20 mã user-agent thực tế được cung cấp sẵn. Danh sách này có chủ đích vượt ra ngoài các crawler cổ điển — Googlebot, Bingbot, và nhóm dự phòng `*` — để bao gồm cả các trình thu thập AI thế hệ hiện tại: GPTBot và OAI-SearchBot (OpenAI), ClaudeBot và anthropic-ai (Anthropic), Google-Extended (tín hiệu từ chối huấn luyện AI của Google, tách biệt với crawler tìm kiếm Googlebot), Applebot-Extended (tùy chọn từ chối tương đương của Apple), PerplexityBot, CCBot (Common Crawl, kho lưu trữ được nhiều mô hình AI khác sử dụng lại), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot và nhiều hơn nữa. Mỗi mã đều đi kèm một giải thích ngắn gọn, trung thực về chức năng thực sự của nó.

Bản thân thuật toán tuân thủ chính xác đặc tả: các nhóm user-agent được khớp không phân biệt chữ hoa/chữ thường, với khớp chính xác hoặc tiền tố mã sản phẩm luôn thắng nhóm dự phòng `*`, và nhiều khối khai báo cùng một mã sẽ được gộp lại như cách crawler thực làm. Trong nhóm thắng cuộc, mọi quy tắc Allow và Disallow đều được kiểm tra với đường dẫn bằng ngữ nghĩa ký tự đại diện chính xác (`*` khớp với bất kỳ chuỗi nào, `$` ở cuối neo vào cuối đường dẫn), và mẫu khớp dài nhất thắng — với Allow thắng nếu hòa với Disallow có cùng độ dài, đúng như tài liệu của Google về triển khai robots.txt của họ.

Bảng kết quả không chỉ nói CHO PHÉP hay BỊ CHẶN — nó chỉ ra chính xác dòng và văn bản quy tắc chịu trách nhiệm, để bạn có thể quay lại tệp của mình và sửa (hoặc xác nhận) chỉ thị quan trọng đó. Đó là chi tiết mà hầu hết các trình kiểm tra robots.txt bỏ qua, và là sự khác biệt giữa việc đoán tại sao một trang không được thu thập dữ liệu và biết chắc chắn lý do.