0

Pemeriksa Persamaan Teks

Bandingkan dua teks dengan persamaan Jaccard n-gram sebenar dan skor pertindihan LCS peringkat perkataan, dengan petikan yang sepadan diserlahkan sebelah menyebelah.

Alat ini hanya membandingkan dua teks yang anda tampalkan di sini — ia tidak mempunyai sambungan Internet, indeks carian atau pangkalan data kandungan, jadi alat ini tidak boleh menyemak plagiarisme terhadap halaman web lain. Pemadanan adalah tidak peka huruf besar-besaran; tanda baca dan pemisah baris diabaikan apabila membuat markah tetapi dikekalkan dalam paparan yang diserlahkan di bawah.

Buy Me a Coffee at ko-fi.com
Memproses... 0%
Tokenizing kedua-dua teks ke dalam perkataan
Pengiraan n-gram persamaan Jaccard
Menjajarkan teks dengan LCS peringkat perkataan
Memaparkan sorotan perkataan dipadankan

Hasilnya

Alat ini membandingkan dua teks yang anda tampal menggunakan dua algoritma bebas, nyata dan didokumentasikan dengan baik — bukan heuristik "kelihatan serupa" yang samar-samar. Yang pertama ialah persamaan Jaccard n-gram: setiap teks ditandakan menjadi perkataan, kemudian dibahagikan kepada larian bertindih bagi n perkataan berturut-turut (n-gram; lalai ialah n=3, trigram, dan anda boleh melaraskannya daripada 1 hingga 5). Indeks Jaccard bagi dua set n-gram yang terhasil — saiz persilangan mereka dibahagikan dengan saiz kesatuan mereka — ialah ukuran persamaan berasaskan set standard yang digunakan merentas perolehan maklumat dan pengesanan hampir pendua. N yang lebih tinggi menangkap frasa kongsi yang lebih panjang dan lebih ketat tentang perkataan yang tepat; n yang lebih rendah adalah lebih memaafkan dan menangkap pertindihan kata yang longgar walaupun antara ayat yang berbeza strukturnya.

Algoritma kedua ialah Urutan Biasa Terpanjang (LCS) peringkat perkataan tulen, dikira dengan jadual pengaturcaraan dinamik O(n·m) sebenar di atas dua jujukan perkataan — algoritma buku teks yang sama digunakan oleh alatan berbeza, bukan anggaran. Tidak seperti skor n-gram, LCS tidak memerlukan perkataan yang dipadankan untuk bersebelahan, jadi ia menangkap pertindihan walaupun apabila ayat telah disusun semula atau disunting sedikit di antara frasa yang dikongsi. Peratusan pertindihan diperoleh daripada panjang LCS berbanding dengan purata panjang kedua-dua teks. Jadual DP kemudiannya diundur untuk mengenal pasti dengan tepat perkataan dalam setiap teks yang mengambil bahagian dalam jujukan biasa terpanjang itu, dan ini ialah ciri yang menonjol: perkataan tersebut dipetakan kembali ke teks asal anda — dengan jarak asalnya, pemisah baris dan tanda baca yang utuh — dan diterjemahkan sebagai rentang yang diserlahkan bersebelahan, supaya anda boleh melihat dengan tepat petikan yang bertindih dan bukannya bertindih.

Skop dan kejujuran penting di sini: ini ialah alat perbandingan dua teks, bukan pengesan plagiarisme. Ia tidak mempunyai sambungan internet, tiada indeks carian dan tiada pangkalan data kandungan orang lain untuk diperiksa — ia hanya boleh memberitahu anda betapa serupanya kedua-dua teks yang anda tampalkan antara satu sama lain. Itu menjadikannya sangat sesuai untuk membandingkan draf semakan, menyemak jumlah parafrasa atau penulisan semula yang sebenarnya berubah, atau mengesan kandungan hampir pendua merentas halaman anda sendiri. Pemadanan perkataan tidak peka huruf besar dan kecil dan jadual LCS O(n·m) dihadkan pada beberapa juta sel pasangan perkataan — untuk teks yang sangat besar (kira-kira beberapa ribu perkataan digabungkan) langkah LCS dan penyerlahan yang tepat dilangkau dengan nota bahasa biasa, manakala skor Jaccard n-gram, yang hanya menelan masa linear, sentiasa dikira pada teks penuh. Semuanya berjalan secara setempat dalam penyemak imbas anda; tiada teks pun meninggalkan peranti anda.