Trình kiểm tra Robots.txt
Dán tệp robots.txt, chọn trình thu thập thông tin — bao gồm GPTBot, ClaudeBot và Google-Extends — và ngay lập tức xem liệu trình thu thập thông tin có thể tìm nạp đường dẫn URL nhất định hay không, với quy tắc chính xác và số dòng đã quyết định điều đó.
kết quả
Tệp robots.txt có vẻ đơn giản để đọc và dễ mắc lỗi một cách đáng ngạc nhiên: một `Disallow: /` nằm sai trong nhóm Tác nhân người dùng không chính xác có thể âm thầm hủy lập chỉ mục toàn bộ trang web, trong khi một quy tắc có vẻ như chặn trình thu thập thông tin có thể bị ghi đè bằng một mẫu dài hơn, cụ thể hơn ở nơi khác trong tệp. Công cụ này triển khai lại thuật toán so khớp thực tế mà các công cụ tìm kiếm và trình thu thập dữ liệu AI sử dụng — Giao thức loại trừ rô-bốt trên thực tế được chính thức hóa trong RFC 9309 và được Google ghi lại — thay vì ước tính nó bằng cách quét từng dòng đơn giản, vì vậy phán quyết mà bạn thấy ở đây là phán đoán mà một trình thu thập thông tin thực sự sẽ tính toán.
Dán nội dung robots.txt của bạn, nhập đường dẫn URL bạn muốn kiểm tra (như `/admin/` hoặc `/blog/draft-post`) và chọn trình thu thập thông tin từ danh sách đi kèm gồm 20 mã thông báo tác nhân người dùng thực. Danh sách đó có chủ ý vượt xa các tác phẩm kinh điển — Googlebot, Bingbot và dự phòng `*` — để bao gồm thế hệ công cụ quét AI hiện tại: GPTBot và OAI-SearchBot (OpenAI), ClaudeBot và anthropic-ai (Anthropic), Google-Extends (tín hiệu từ chối đào tạo AI của Google, tách biệt với trình thu thập thông tin tìm kiếm của Googlebot), Applebot-Extends (tín hiệu chọn không tham gia tương đương của Apple), PerplexityBot, CCBot (Common Crawl, có kho lưu trữ cung cấp nhiều mô hình AI khác), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot, v.v. Mỗi mã thông báo đều có lời giải thích ngắn gọn, trung thực về bản chất thực sự của nó.
Bản thân thuật toán tuân theo thông số kỹ thuật một cách chính xác: các nhóm tác nhân người dùng được khớp không phân biệt chữ hoa chữ thường, với khớp chính xác hoặc tiền tố trên mã thông báo sản phẩm luôn đánh bại nhóm dự phòng `*` và nhiều khối khai báo cùng một mã thông báo sẽ được hợp nhất như các trình thu thập thông tin thực sự thực hiện. Trong nhóm chiến thắng, mọi quy tắc Cho phép và Không cho phép đều được kiểm tra theo đường dẫn bằng cách sử dụng ngữ nghĩa ký tự đại diện thích hợp (`*` khớp với bất kỳ chuỗi nào, dấu `$` ở cuối đường dẫn) và mẫu khớp dài nhất sẽ thắng — với Cho phép thắng bất kỳ trận hòa nào với Không cho phép có độ dài bằng nhau, chính xác như được ghi lại bằng quá trình triển khai robots.txt của chính Google.
Bảng kết quả không chỉ cho phép hoặc BLOCKED - nó đặt tên chính xác cho dòng và văn bản quy tắc chịu trách nhiệm, do đó bạn có thể quay lại ngay tệp của mình và sửa (hoặc xác nhận) lệnh quan trọng. Đó là chi tiết mà hầu hết các trình kiểm tra robots.txt đều bỏ qua và đó là sự khác biệt giữa việc đoán lý do một trang không được thu thập dữ liệu và biết chắc chắn lý do.