Pemeriksa Kemiripan Teks
Bandingkan dua teks dengan kemiripan n-gram Jaccard nyata dan skor tumpang-tindih LCS tingkat kata, dengan bagian yang cocok disorot berdampingan.
🔒 Diproses sepenuhnya di browser Anda — apa pun yang Anda masukkan di sini tidak akan pernah diunggah.
Hasil
Alat ini membandingkan dua teks yang Anda tempel menggunakan dua algoritma independen, nyata, dan terdokumentasi dengan baik — bukan heuristik "terlihat mirip" yang samar. Yang pertama adalah kemiripan n-gram Jaccard: setiap teks ditokenisasi menjadi kata, lalu dipecah menjadi rangkaian tumpang-tindih dari n kata berurutan (sebuah n-gram; nilai default adalah n=3, trigram, dan Anda dapat menyesuaikannya dari 1 hingga 5). Indeks Jaccard dari dua himpunan n-gram yang dihasilkan — ukuran irisannya dibagi ukuran gabungannya — adalah ukuran kemiripan berbasis himpunan standar yang digunakan di temu balik informasi dan deteksi hampir duplikat. n yang lebih tinggi menangkap frasa bersama yang lebih panjang dan lebih ketat terhadap kata persis; n yang lebih rendah lebih toleran dan menangkap tumpang-tindih kata longgar bahkan di antara kalimat yang strukturnya berbeda.
Algoritma kedua adalah Longest Common Subsequence (LCS) tingkat kata sejati, dihitung dengan tabel pemrograman dinamis O(n·m) nyata di atas dua urutan kata — algoritma buku teks yang sama yang digunakan oleh alat diff, bukan aproksimasi. Tidak seperti skor n-gram, LCS tidak mensyaratkan kata yang cocok harus bersebelahan, sehingga ia menangkap tumpang-tindih bahkan ketika sebuah kalimat telah diurut ulang atau sedikit disunting di antara frasa bersama. Persentase tumpang-tindih diturunkan dari panjang LCS relatif terhadap panjang rata-rata kedua teks. Tabel DP kemudian dirunut balik untuk mengidentifikasi persis kata mana di setiap teks yang berperan dalam longest common sequence tersebut, dan ini adalah fitur unggulannya: kata-kata itu dipetakan kembali ke teks asli Anda — dengan spasi, jeda baris, dan tanda baca asli tetap utuh — dan dirender sebagai rentang yang disorot berdampingan, sehingga Anda dapat melihat persis bagian mana yang tumpang tindih alih-alih sekadar percaya pada angka mentah.
Lingkup dan kejujuran penting di sini: ini adalah alat perbandingan dua teks, bukan detektor plagiarisme. Alat ini tidak memiliki koneksi internet, indeks pencarian, atau basis data konten orang lain untuk diperiksa — alat ini hanya dapat memberi tahu seberapa mirip kedua teks yang Anda tempel satu sama lain. Itu menjadikannya cocok untuk membandingkan revisi draf, memeriksa seberapa banyak parafrasa atau tulis ulang benar-benar berubah, atau menemukan konten hampir duplikat di halaman Anda sendiri. Pencocokan kata tidak peka huruf besar/kecil, dan tabel LCS O(n·m) dibatasi hingga beberapa juta sel pasangan kata — untuk teks yang sangat besar (sekitar beberapa ribu kata gabungan) langkah LCS eksak dan penyorotan dilewati dengan catatan bahasa sederhana, sementara skor n-gram Jaccard, yang hanya memerlukan waktu linear, selalu dihitung pada teks penuh. Semuanya berjalan secara lokal di peramban Anda; tidak satu pun teks meninggalkan perangkat Anda.