0

Penyemak Persamaan Teks

Bandingkan dua teks dengan persamaan Jaccard n-gram sebenar dan skor pertindihan LCS peringkat perkataan, dengan petikan yang sepadan diserlahkan bersebelahan.

🔒 Diproses sepenuhnya dalam penyemak imbas anda — tiada apa yang anda masukkan di sini pernah dimuat naik.

Alat ini hanya membandingkan dua teks yang anda tampal di sini — ia tiada sambungan internet, indeks carian, atau pangkalan data kandungan, jadi ia tidak boleh menyemak plagiarisme terhadap halaman web lain. Pemadanan adalah tidak peka huruf besar/kecil; tanda baca dan pemisah baris diabaikan semasa pemarkahan tetapi dikekalkan dalam paparan sorotan di bawah.

Memproses... 0%
Menokenkan kedua-dua teks kepada perkataan
Mengira persamaan Jaccard n-gram
Menjajarkan teks dengan LCS peringkat perkataan
Memaparkan sorotan perkataan yang sepadan

Keputusan

Alat ini membandingkan dua teks yang anda tampal menggunakan dua algoritma bebas, sebenar, dan didokumentasikan dengan baik — bukan heuristik samar “nampak serupa”. Yang pertama ialah persamaan Jaccard n-gram: setiap teks ditokenkan kepada perkataan, kemudian dipecahkan kepada larian bertindih n perkataan berturutan (sebuah n-gram; lalainya n=3, sebuah trigram, dan anda boleh melaraskannya dari 1 hingga 5). Indeks Jaccard bagi dua set n-gram yang terhasil — saiz persilangan mereka dibahagikan dengan saiz gabungan mereka — adalah ukuran persamaan berasaskan set piawai yang digunakan dalam perolehan maklumat dan pengesanan hampir pendua. n yang lebih tinggi menangkap ungkapan bersama yang lebih panjang dan lebih ketat tentang perkataan tepat; n yang lebih rendah lebih toleran dan menangkap pertindihan perkataan longgar walaupun antara ayat yang berbeza struktur.

Algoritma kedua ialah Jujukan Sepunya Terpanjang (LCS) peringkat perkataan tulen, dikira dengan jadual pemrograman dinamik O(n·m) sebenar ke atas dua jujukan perkataan — algoritma buku teks yang sama digunakan oleh alat diff, bukan penghampiran. Tidak seperti skor n-gram, LCS tidak memerlukan perkataan yang dipadankan untuk bersebelahan, jadi ia menangkap pertindihan walaupun apabila satu ayat telah disusun semula atau disunting ringan di antara frasa yang dikongsi. Peratusan pertindihan diterbitkan daripada panjang LCS relatif kepada purata panjang kedua-dua teks. Jadual DP kemudian dijejak balik untuk mengenal pasti dengan tepat perkataan dalam setiap teks yang mengambil bahagian dalam jujukan sepunya terpanjang itu, dan ini adalah ciri menonjol: perkataan tersebut dipetakan kembali ke teks asal anda — dengan jarak asal, pemisah baris, dan tanda baca yang utuh — dan dipaparkan sebagai rentang yang diserlahkan bersebelahan, supaya anda dapat melihat dengan tepat petikan yang bertindih dan bukannya hanya mempercayai satu nombor mentah.

Skop dan kejujuran penting di sini: ini adalah alat perbandingan dua teks, bukan pengesan plagiarisme. Ia tiada sambungan internet, tiada indeks carian, dan tiada pangkalan data kandungan orang lain untuk disemak — ia hanya boleh memberitahu anda betapa serupanya dua teks yang anda tampal antara satu sama lain. Itu menjadikannya sangat sesuai untuk membandingkan semakan draf, menyemak berapa banyak parafrasa atau penulisan semula sebenarnya berubah, atau mengesan kandungan hampir pendua di seluruh halaman anda sendiri. Pemadanan perkataan adalah tidak peka huruf besar/kecil, dan jadual LCS O(n·m) dihadkan pada beberapa juta sel pasangan perkataan — untuk teks yang sangat besar (kira-kira beberapa ribu patah perkataan digabungkan) langkah LCS tepat dan sorotan dilangkau dengan nota bahasa biasa, sementara skor Jaccard n-gram, yang hanya memerlukan masa linear, sentiasa dikira pada teks penuh. Semuanya berjalan secara setempat dalam pelayar anda; kedua-dua teks tidak pernah meninggalkan peranti anda.