0

Pemeriksa Kemiripan Teks

Bandingkan dua teks dengan kemiripan n-gram Jaccard yang sebenarnya dan skor tumpang tindih LCS tingkat kata, dengan bagian yang cocok disorot secara berdampingan.

Alat ini hanya membandingkan dua teks yang Anda tempel di sini — alat ini tidak memiliki koneksi internet, indeks pencarian, atau basis data konten, sehingga tidak dapat memeriksa plagiarisme terhadap halaman web lain. Pencocokan tidak peka huruf besar-kecil; tanda baca dan jeda baris diabaikan saat memberi skor tetapi dipertahankan dalam tampilan yang disorot di bawah.

Buy Me a Coffee at ko-fi.com
Memproses... 0%
Tokenisasi kedua teks menjadi kata-kata
Menghitung kesamaan n-gram Jaccard
Menyelaraskan teks dengan LCS tingkat kata
Merender sorotan kata yang cocok

Hasil

Alat ini membandingkan dua teks yang Anda tempelkan menggunakan dua algoritme independen, nyata, dan terdokumentasi dengan baik — bukan heuristik "tampak serupa" yang samar-samar. Yang pertama adalah kesamaan n-gram Jaccard: setiap teks diberi token menjadi kata-kata, kemudian dipecah menjadi rangkaian n kata berurutan yang tumpang tindih (n-gram; defaultnya adalah n=3, sebuah trigram, dan Anda dapat menyesuaikannya dari 1 hingga 5). Indeks Jaccard dari dua kumpulan n-gram yang dihasilkan — ukuran perpotongannya dibagi dengan ukuran gabungannya — adalah ukuran kesamaan berbasis kumpulan standar yang digunakan pada pengambilan informasi dan deteksi hampir duplikat. N yang lebih tinggi menangkap frasa bersama yang lebih panjang dan lebih ketat mengenai kata-kata yang tepat; n yang lebih rendah lebih memaafkan dan menangkap kata-kata yang tumpang tindih bahkan di antara kalimat-kalimat yang memiliki struktur berbeda.

Algoritme kedua adalah Urutan Umum Terpanjang (LCS) tingkat kata asli, yang dihitung dengan tabel pemrograman dinamis O(n·m) nyata pada dua rangkaian kata — algoritme buku teks yang sama yang digunakan oleh alat diff, bukan perkiraan. Berbeda dengan skor n-gram, LCS tidak memerlukan kata-kata yang cocok untuk berdekatan, sehingga dapat menangkap tumpang tindih bahkan ketika sebuah kalimat telah disusun ulang atau sedikit diedit di antara frasa yang digunakan bersama. Persentase tumpang tindih diperoleh dari panjang LCS relatif terhadap rata-rata panjang kedua teks. Tabel DP kemudian dilacak kembali untuk mengidentifikasi dengan tepat kata-kata mana dalam setiap teks yang mengambil bagian dalam urutan umum terpanjang tersebut, dan ini adalah fitur yang paling menonjol: kata-kata tersebut dipetakan kembali ke teks asli Anda — dengan spasi asli, jeda baris, dan tanda baca utuh — dan ditampilkan sebagai rentang yang disorot secara berdampingan, sehingga Anda dapat melihat dengan tepat bagian mana yang tumpang tindih alih-alih memercayai angka kosong.

Cakupan dan kejujuran penting di sini: ini adalah alat perbandingan dua teks, bukan pendeteksi plagiarisme. Ia tidak memiliki koneksi internet, tidak ada indeks pencarian, dan tidak ada database konten orang lain untuk diperiksa — ia hanya dapat memberi tahu Anda seberapa mirip dua teks yang Anda tempelkan satu sama lain. Hal ini membuatnya sangat cocok untuk membandingkan draf revisi, memeriksa seberapa banyak parafrase atau penulisan ulang benar-benar berubah, atau menemukan konten yang hampir duplikat di halaman Anda sendiri. Pencocokan kata tidak peka huruf besar-kecil, dan tabel LCS O(n·m) dibatasi pada beberapa juta sel pasangan kata — untuk teks yang sangat besar (kira-kira gabungan beberapa ribu kata), langkah LCS dan penyorotan yang tepat dilewati dengan catatan bahasa biasa, sedangkan skor Jaccard n-gram, yang hanya memerlukan waktu linier, selalu dihitung pada teks lengkap. Semuanya berjalan secara lokal di browser Anda; tidak ada teks yang keluar dari perangkat Anda.