0

ตัวทดสอบ Robots.txt

วางไฟล์ robots.txt เลือกโปรแกรมรวบรวมข้อมูล รวมถึง GPTBot, ClaudeBot และ Google-Extensed และดูได้ทันทีว่าสามารถดึงเส้นทาง URL ที่กำหนดได้หรือไม่ โดยใช้กฎและหมายเลขบรรทัดที่แน่ชัดในการตัดสินใจ

Buy Me a Coffee at ko-fi.com
กำลังประมวลผล... 0%
กำลังแยกวิเคราะห์ robots.txt
กฎของโปรแกรมรวบรวมข้อมูลที่ตรงกัน
เสร็จแล้ว

ผลลัพธ์

ไฟล์ robots.txt อ่านง่ายจนน่าตกใจและผิดพลาดง่ายอย่างน่าประหลาดใจ ไฟล์ `Disallow: /` ที่หลงเหลืออยู่ภายใต้กลุ่ม User-agent ที่ไม่ถูกต้องสามารถยกเลิกการจัดทำดัชนีทั้งเว็บไซต์ได้โดยไม่แจ้งให้ทราบ ในขณะที่กฎที่ดูเหมือนว่าจะบล็อกโปรแกรมรวบรวมข้อมูลสามารถถูกแทนที่ด้วยรูปแบบที่ยาวและเฉพาะเจาะจงมากขึ้นในส่วนอื่นของไฟล์ เครื่องมือนี้ปรับใช้เครื่องมือค้นหาอัลกอริธึมการจับคู่จริงและโปรแกรมรวบรวมข้อมูล AI ที่ใช้งานจริงอีกครั้ง - de-facto Robots Exclusion Protocol ที่เป็นทางการใน RFC 9309 และจัดทำเอกสารโดย Google - แทนที่จะประมาณด้วยการสแกนทีละบรรทัดง่ายๆ ดังนั้นคำตัดสินที่คุณเห็นที่นี่คือคำตัดสินที่โปรแกรมรวบรวมข้อมูลจริงจะคำนวณ

วางเนื้อหา robots.txt พิมพ์เส้นทาง URL ที่คุณต้องการตรวจสอบ (เช่น `/admin/` หรือ `/blog/draft-post`) และเลือกโปรแกรมรวบรวมข้อมูลจากรายการรวมโทเค็นตัวแทนผู้ใช้จริง 20 รายการ รายการดังกล่าวมีเจตนานอกเหนือไปจากรายการคลาสสิก เช่น Googlebot, Bingbot และทางเลือก `*` เพื่อรวม AI scrapers รุ่นปัจจุบัน: GPTBot และ OAI-SearchBot (OpenAI), ClaudeBot และ anthropic-ai (Anthropic), Google-Extensed (สัญญาณการเลือกไม่รับการฝึกอบรม AI ของ Google แยกจากโปรแกรมรวบรวมข้อมูลการค้นหาของ Googlebot), Applebot-Exted (การเลือกไม่รับที่เทียบเท่ากับ Apple), PerplexityBot, CCBot (Common Crawl ซึ่งไฟล์เก็บถาวรฟีดโมเดล AI อื่นๆ มากมาย), Bytespider (ByteDance), Meta-ExternalAgent, Amazonbot และอื่นๆ อีกมากมาย โทเค็นทุกอันมาพร้อมกับคำอธิบายสั้นๆ และตรงไปตรงมาว่าแท้จริงแล้วคืออะไร

อัลกอริธึมนั้นเป็นไปตามข้อกำหนดอย่างแม่นยำ: กลุ่มตัวแทนผู้ใช้จะถูกจับคู่โดยไม่คำนึงถึงขนาดตัวพิมพ์ โดยการจับคู่แบบตรงทั้งหมดหรือคำนำหน้าบนโทเค็นผลิตภัณฑ์จะเอาชนะกลุ่มทางเลือก `*` เสมอ และบล็อกหลายบล็อกที่ประกาศโทเค็นเดียวกันจะถูกรวมเข้าด้วยกันเหมือนกับที่โปรแกรมรวบรวมข้อมูลจริงทำ ภายในกลุ่มที่ชนะ กฎ Allow และ Disallow ทุกกฎจะถูกตรวจสอบกับเส้นทางโดยใช้ความหมายไวด์การ์ดที่เหมาะสม (`*` จับคู่ลำดับใดๆ โดยมีจุดยึด `$` ต่อท้ายที่ส่วนท้ายของเส้นทาง) และรูปแบบการจับคู่ที่ยาวที่สุดจะชนะ โดยที่ Allow จะชนะเสมอกับ Disallow ที่มีความยาวเท่ากัน ทุกประการตามที่บันทึกไว้โดยการใช้ robots.txt ของ Google

แผงผลลัพธ์ไม่เพียงแต่ระบุว่าอนุญาตหรือถูกบล็อกเท่านั้น แต่ยังตั้งชื่อบรรทัดและข้อความกฎที่รับผิดชอบ ดังนั้นคุณจึงสามารถกลับไปที่ไฟล์ของคุณได้โดยตรงและแก้ไข (หรือยืนยัน) คำสั่งที่สำคัญ นั่นคือรายละเอียดที่ตัวตรวจสอบ robots.txt ส่วนใหญ่จะข้ามไป และนี่คือความแตกต่างระหว่างการเดาว่าทำไมหน้าเว็บจึงไม่ถูกรวบรวมข้อมูลกับการรู้แน่ชัด