ตัวตรวจสอบความคล้ายคลึงกันของข้อความ
เปรียบเทียบข้อความสองฉบับที่มีความคล้ายคลึงกันของแจ็กการ์ด n-gram จริงและคะแนน LCS ที่ทับซ้อนกันในระดับคำ โดยเน้นข้อความที่ตรงกันไว้เคียงข้างกัน
ผลลัพธ์
เครื่องมือนี้เปรียบเทียบข้อความสองข้อความที่คุณวางโดยใช้อัลกอริธึมที่เป็นอิสระ เป็นจริง และมีเอกสารประกอบอย่างดี ไม่ใช่ฮิวริสติกที่ "ดูคล้ายกัน" ที่คลุมเครือ อย่างแรกคือความคล้ายคลึงกันของแจ็กการ์ดขนาด n-gram: แต่ละข้อความจะถูกแปลงเป็นคำ จากนั้นแบ่งออกเป็น n คำที่เรียงซ้อนกัน (n-gram; ค่าเริ่มต้นคือ n=3, ไตรแกรม และคุณสามารถปรับได้ตั้งแต่ 1 ถึง 5) ดัชนี Jaccard ของผลลัพธ์ชุด n-gram สองชุด ซึ่งก็คือขนาดของจุดตัดหารด้วยขนาดของการรวมเข้าด้วยกัน เป็นการวัดความคล้ายคลึงกันแบบอิงชุดมาตรฐาน ซึ่งใช้ในการดึงข้อมูลและการตรวจจับที่เกือบจะซ้ำกัน n ที่สูงกว่าจะจับการใช้ถ้อยคำที่ยาวกว่าและเข้มงวดกับการใช้ถ้อยคำที่ตรงทั้งหมด n ที่ต่ำกว่าจะช่วยให้ให้อภัยได้มากกว่าและเข้าใจคำที่ซ้อนทับกันหลวมๆ แม้ว่าจะอยู่ในประโยคที่มีโครงสร้างต่างกันก็ตาม
อัลกอริธึมที่สองคือลำดับที่ยาวที่สุดทั่วไประดับคำของแท้ (LCS) ซึ่งคำนวณด้วยตารางการเขียนโปรแกรมไดนามิก O(n·m) จริงเหนือลำดับสองคำ - อัลกอริธึมในตำราเรียนแบบเดียวกับที่ใช้โดยเครื่องมือ diff ไม่ใช่การประมาณ ต่างจากคะแนน n-gram LCS ไม่ต้องการคำที่ตรงกันเพื่อให้อยู่ติดกัน ดังนั้นจึงจับการทับซ้อนกันแม้ว่าจะมีการเรียงลำดับประโยคใหม่หรือแก้ไขเล็กน้อยระหว่างวลีที่ใช้ร่วมกันก็ตาม เปอร์เซ็นต์การทับซ้อนกันได้มาจากความยาว LCS ที่สัมพันธ์กับความยาวเฉลี่ยของข้อความทั้งสอง จากนั้นตาราง DP จะถูกย้อนรอยเพื่อระบุอย่างแม่นยำว่าคำใดในแต่ละข้อความมีส่วนร่วมในลำดับทั่วไปที่ยาวที่สุด และนี่คือคุณลักษณะที่โดดเด่น: คำเหล่านั้นจะถูกแมปกลับไปยังข้อความต้นฉบับของคุณ โดยมีระยะห่าง การแบ่งบรรทัด และเครื่องหมายวรรคตอนเดิมเหมือนเดิม และแสดงเป็นช่วงที่ไฮไลต์เคียงข้างกัน คุณจึงสามารถดูได้อย่างชัดเจนว่าข้อความใดทับซ้อนกัน แทนที่จะเชื่อถือตัวเลขเปล่าๆ
ขอบเขตและความซื่อสัตย์ในที่นี้: นี่เป็นเครื่องมือเปรียบเทียบแบบสองข้อความ ไม่ใช่เครื่องมือตรวจจับการลอกเลียนแบบ ไม่มีการเชื่อมต่ออินเทอร์เน็ต ไม่มีดัชนีการค้นหา และไม่มีฐานข้อมูลเนื้อหาของบุคคลอื่นที่จะตรวจสอบ - มันสามารถบอกคุณได้ว่าข้อความทั้งสองที่คุณวางมีความคล้ายคลึงกันเพียงใด ซึ่งทำให้เหมาะสมอย่างยิ่งในการเปรียบเทียบการแก้ไขฉบับร่าง การตรวจสอบว่าการถอดความหรือการเขียนซ้ำมีการเปลี่ยนแปลงไปมากน้อยเพียงใด หรือพบเนื้อหาที่เกือบจะซ้ำกันในหน้าของคุณเอง การจับคู่คำไม่คำนึงถึงตัวพิมพ์เล็กและตัวพิมพ์ใหญ่ และตาราง LCS ของ O(n·m) ถูกต่อยอดไว้ที่เซลล์คู่คำสองสามล้านเซลล์ สำหรับข้อความที่มีขนาดใหญ่มาก (ประมาณสองสามพันคำรวมกัน) LCS ที่แน่นอนและขั้นตอนการเน้นจะถูกข้ามไปพร้อมกับบันทึกย่อภาษาธรรมดา ในขณะที่คะแนน Jaccard n-gram ซึ่งใช้เวลาเชิงเส้นเท่านั้น จะถูกคำนวณจากข้อความฉบับเต็มเสมอ ทุกอย่างทำงานภายในเบราว์เซอร์ของคุณ ไม่มีข้อความใดหลุดออกจากอุปกรณ์ของคุณ