0

ตัวตรวจสอบความคล้ายคลึงของข้อความ

เปรียบเทียบข้อความสองชุดด้วยความคล้ายคลึง Jaccard แบบ n-gram จริง และคะแนนการซ้อนทับแบบ word-level LCS พร้อมไฮไลต์ข้อความที่ตรงกันเทียบกัน

🔒 ประมวลผลทั้งหมดในเบราว์เซอร์ของคุณ — ไม่มีการอัปโหลดสิ่งใดที่คุณป้อนที่นี่

เครื่องมือนี้เปรียบเทียบเฉพาะข้อความสองชุดที่คุณวางที่นี่ — มันไม่มีการเชื่อมต่ออินเทอร์เน็ต ดัชนีค้นหา หรือฐานข้อมูลเนื้อหา ดังนั้นจึงไม่สามารถตรวจสอบการลอกเลียนแบบกับหน้าเว็บอื่นได้ การจับคู่ไม่คำนึงถึงตัวพิมพ์เล็ก-ใหญ่; เครื่องหมายวรรคตอนและการขึ้นบรรทัดใหม่จะถูกละเว้นในการให้คะแนน แต่จะคงไว้ในมุมมองไฮไลต์ด้านล่าง

กำลังประมวลผล... 0%
กำลังตัดข้อความทั้งสองเป็นคำ
กำลังคำนวณความคล้ายคลึง Jaccard แบบ n-gram
กำลังจัดเรียงข้อความด้วย word-level LCS
กำลังแสดงผลการไฮไลต์คำที่ตรงกัน

ผลลัพธ์

เครื่องมือนี้เปรียบเทียบข้อความสองชุดที่คุณวางเข้ามา โดยใช้อัลกอริทึมจริงสองแบบที่แยกจากกัน เป็นที่รู้จัก และมีเอกสารอ้างอิง — ไม่ใช่ฮิวริสติกแบบคลุมเครือว่า "ดูคล้ายกัน" แบบแรกคือความคล้ายคลึง Jaccard แบบ n-gram: ข้อความแต่ละชุดจะถูกตัดเป็นคำ แล้วแบ่งเป็นกลุ่มคำที่ซ้อนทับกันครั้งละ n คำ (เรียกว่า n-gram; ค่าเริ่มต้นคือ n=3, trigram และคุณสามารถปรับได้ตั้งแต่ 1 ถึง 5) ดัชนี Jaccard ของเซต n-gram ที่ได้ทั้งสองเซต — คือขนาดของอินเตอร์เซกชันหารด้วยขนาดของยูเนียน — เป็นการวัดความคล้ายคลึงแบบอิงเซตมาตรฐานที่ใช้ในงานค้นคืนสารสนเทศและการตรวจจับเนื้อหาซ้ำกัน ค่า n ที่สูงจะจับวลีที่ใช้ร่วมกันที่ยาวกว่าและเข้มงวดในการเลือกใช้คำมากกว่า; ค่า n ที่ต่ำจะยืดหยุ่นกว่าและจับคำที่ซ้อนทับกันแบบหลวม ๆ แม้ในประโยคที่มีโครงสร้างต่างกัน

อัลกอริทึมที่สองคือลำดับคำร่วมที่ยาวที่สุด (Longest Common Subsequence) แบบ word-level จริง ซึ่งคำนวณด้วยตาราง dynamic programming จริง O(n·m) บนลำดับคำสองชุด — เป็นอัลกอริทึมตามตำราเดียวกับที่เครื่องมือ diff ใช้ ไม่ใช่การประมาณค่า ซึ่งต่างจากคะแนน n-gram ตรงที่ LCS ไม่จำเป็นต้องให้คำที่ตรงกันอยู่ติดกัน ดังนั้นจึงจับการซ้อนทับได้แม้ในกรณีที่มีการเรียงประโยคใหม่หรือแก้ไขเล็กน้อยระหว่างวลีที่ใช้ร่วมกัน เปอร์เซ็นต์การซ้อนทับคำนวณจากความยาวของ LCS เทียบกับความยาวเฉลี่ยของข้อความทั้งสอง จากนั้นตาราง DP จะถูกย้อนรอยเพื่อระบุว่าคำใดในแต่ละข้อความเป็นส่วนหนึ่งของลำดับร่วมที่ยาวที่สุดนั้น และนี่คือคุณสมบัติเด่น: คำเหล่านั้นจะถูกแมปกลับไปยังข้อความต้นฉบับของคุณ — โดยคงการเว้นวรรค การขึ้นบรรทัดใหม่ และเครื่องหมายวรรคตอนไว้ตามเดิม — และแสดงผลเป็นช่วงข้อความที่ถูกไฮไลต์เทียบข้างกัน คุณจึงเห็นได้อย่างชัดเจนว่าข้อความส่วนใดซ้อนทับกัน แทนที่จะเชื่อตามตัวเลขเปล่า ๆ

ขอบเขตและความซื่อสัตย์เป็นสิ่งสำคัญ ณ ที่นี้: นี่คือเครื่องมือเปรียบเทียบข้อความสองชุด ไม่ใช่เครื่องมือตรวจจับการลอกเลียนแบบ มันไม่มีการเชื่อมต่ออินเทอร์เน็ต ไม่มีดัชนีค้นหา และไม่มีฐานข้อมูลเนื้อหาของผู้อื่นให้ตรวจสอบ — มันทำได้เพียงบอกคุณว่าข้อความสองชุดที่คุณวางเข้ามานั้นคล้ายคลึงกันแค่ไหนเท่านั้น ด้วยเหตุนี้จึงเหมาะอย่างยิ่งสำหรับการเปรียบเทียบร่างแก้ไข ตรวจสอบว่าการถอดความหรือเขียนใหม่เปลี่ยนแปลงไปมากน้อยเพียงใด หรือค้นหาเนื้อหาที่ซ้ำกันในหน้าของคุณเอง การจับคู่คำไม่คำนึงถึงตัวพิมพ์เล็ก-ใหญ่ และตาราง LCS O(n·m) ถูกจำกัดไว้ที่ไม่กี่ล้านเซลล์คู่คำ — สำหรับข้อความขนาดใหญ่มาก (ประมาณสองสามพันคำรวมกัน) ขั้นตอน LCS แบบตรงทั้งหมดและการไฮไลต์จะถูกข้ามไปพร้อมข้อความแจ้งเป็นภาษาธรรมดา ในขณะที่คะแนน Jaccard แบบ n-gram ซึ่งใช้เวลาเชิงเส้นเท่านั้นจะถูกคำนวณบนข้อความเต็มเสมอ ทุกอย่างทำงานภายในเบราว์เซอร์ของคุณ; ข้อความทั้งสองไม่เคยออกจากอุปกรณ์ของคุณ