ตัวทดสอบ Robots.txt
วางไฟล์ robots.txt เลือก crawler — รวมถึง GPTBot, ClaudeBot และ Google-Extended — แล้วดูได้ทันทีว่าสามารถดึง path URL ที่กำหนดได้หรือไม่ พร้อมกฎและหมายเลขบรรทัดที่ตัดสินผล
🔒 ประมวลผลทั้งหมดในเบราว์เซอร์ของคุณ — ไม่มีการอัปโหลดสิ่งใดที่คุณป้อนที่นี่
ผลลัพธ์
ไฟล์ robots.txt อ่านง่ายอย่างหลอกลวง แต่ทำให้ผิดพลาดได้ง่ายอย่างไม่น่าเชื่อ: `Disallow: /` ใต้กลุ่ม User-agent ผิดกลุ่ม อาจทำให้ทั้งเว็บหายไปจากดัชนีอย่างเงียบ ๆ ในขณะที่กฎที่ดูเหมือนบล็อก crawler อาจถูกแทนที่ด้วย pattern ที่ยาวกว่าจากส่วนอื่นของไฟล์ เครื่องมือนี้จำลองขั้นตอนการจับคู่จริงที่ search engine และ AI crawler ใช้ — โปรโตคอล Robots Exclusion Protocol โดยพฤตินัยที่ระบุใน RFC 9309 และจัดทำโดย Google — แทนที่จะประมาณการด้วยการสแกนทีละบรรทัด ดังนั้นผลลัพธ์ที่คุณเห็นคือสิ่งที่ crawler จริงจะคำนวณได้
วางเนื้อหา robots.txt ของคุณ พิมพ์ path URL ที่ต้องการตรวจสอบ (เช่น `/admin/` หรือ `/blog/draft-post`) และเลือก crawler จากรายการโทเค็น user-agent จริง 20 ตัว รายการนี้จงใจครอบคลุมมากกว่าแค่คลาสสิก — Googlebot, Bingbot และ `*` — เพื่อรวม AI scraper รุ่นปัจจุบัน: GPTBot และ OAI-SearchBot (OpenAI), ClaudeBot และ anthropic-ai (Anthropic), Google-Extended (สัญญาณ opt-out การเทรน AI ของ Google แยกจาก Googlebot), Applebot-Extended (สัญญาณ opt-out เทียบเท่าของ Apple), PerplexityBot, CCBot (Common Crawl ที่เก็บถาวรเป็นวัตถุดิบให้โมเดล AI อื่น ๆ), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot และอีกมากมาย แต่ละโทเค็นมาพร้อมคำอธิบายสั้น ๆ ตรงไปตรงมาว่ามันคืออะไร
ขั้นตอนวิธีเป็นไปตามสเปกอย่างแม่นยำ: กลุ่ม user-agent ถูกจับคู่แบบ case-insensitive โดยการจับคู่แบบตรงตัวหรือขึ้นต้นด้วยโทเค็นจะชนะกลุ่ม `*` เสมอ และหลายบล็อกที่ประกาศโทเค็นเดียวกันจะถูกรวมเข้าด้วยกันเหมือนที่ crawler จริงทำ ภายในกลุ่มที่ชนะ กฎ Allow และ Disallow ทุกตัวจะถูกตรวจสอบกับ path โดยใช้ semantics ของ wildcard อย่างถูกต้อง (`*` จับคู่ลำดับใดก็ได้, `$` ที่ตามหลังจะยึดกับท้าย path) และ pattern ที่ยาวที่สุดที่ตรงกันจะเป็นผู้ชนะ — โดย Allow จะชนะ Disallow ที่ยาวเท่ากันเสมอ ตามที่จัดทำโดยการใช้งาน robots.txt ของ Google เอง
แผงผลลัพธ์ไม่ได้บอกแค่ ALLOWED หรือ BLOCKED — มันระบุบรรทัดและข้อความกฎที่แน่นอนที่รับผิดชอบ เพื่อให้คุณกลับไปที่ไฟล์และแก้ไข (หรือยืนยัน) คำสั่งที่สำคัญได้ทันที นั่นคือรายละเอียดที่เครื่องมือตรวจสอบ robots.txt ส่วนใหญ่มองข้าม และเป็นความแตกต่างระหว่างการเดาว่าทำไมหน้าถึงไม่ถูก crawl กับการรู้แน่ชัด