0

Provjera sličnosti teksta

Usporedite dva teksta stvarnom Jaccardovom sličnošću n-grama i rezultatom preklapanja LCS-a na razini riječi, s podudarnim odlomcima istaknutima jedan pored drugog.

🔒 U potpunosti se obrađuje u vašem pregledniku — ništa što ovdje unesete nikada se ne učitava.

Ovaj alat uspoređuje samo dva teksta koja ovdje zalijepite — nema internetsku vezu, indeks pretraživanja ni bazu podataka sadržaja, stoga ne može provjeriti plagijat u odnosu na druge web stranice. Podudaranje ne razlikuje velika i mala slova; interpunkcija i prijelomi redaka zanemaruju se prilikom bodovanja, ali su očuvani u istaknutom prikazu ispod.

Obrada... 0%
Tokenizacija oba teksta u riječi
Izračun Jaccardove sličnosti n-grama
Usklađivanje tekstova LCS-om na razini riječi
Iscrtavanje isticanja podudarnih riječi

Rezultat

Ovaj alat uspoređuje dva teksta koja zalijepite koristeći dva neovisna, stvarna, dobro dokumentirana algoritma — ne nejasnu heuristiku 'izgleda slično'. Prvi je Jaccardova sličnost n-grama: svaki se tekst tokenizira u riječi, zatim dijeli u preklapajuće nizove od n uzastopnih riječi (n-gram; zadana vrijednost je n=3, trigram, a možete je podesiti od 1 do 5). Jaccardov indeks dvaju dobivenih skupova n-grama — veličina njihova presjeka podijeljena s veličinom njihove unije — standardna je mjera sličnosti temeljena na skupovima koja se koristi u pronalaženju informacija i otkrivanju gotovo dupliciranog sadržaja. Viši n hvata dulje zajedničke fraze i stroži je glede točnog izričaja; niži n je popustljiviji i hvata labavo preklapanje riječi čak i između različito strukturiranih rečenica.

Drugi algoritam je pravi najdulji zajednički podslijed na razini riječi (LCS), izračunat stvarnom tablicom dinamičkog programiranja O(n·m) nad dvama nizovima riječi — isti udžbenički algoritam koji koriste diff alati, a ne aproksimacija. Za razliku od rezultata n-grama, LCS ne zahtijeva da podudarne riječi budu susjedne, pa hvata preklapanje čak i kada je rečenica preuređena ili lagano uređena između zajedničkih fraza. Postotak preklapanja izveden je iz duljine LCS-a u odnosu na prosječnu duljinu oba teksta. DP tablica se zatim prati unatrag kako bi se identificiralo točno koje su riječi u svakom tekstu sudjelovale u tom najduljem zajedničkom nizu, i to je istaknuta značajka: te se riječi mapiraju natrag na vaš izvorni tekst — s netaknutim izvornim razmacima, prijelomima redaka i interpunkcijom — i prikazuju kao istaknuti odsječci jedan pored drugog, tako da možete točno vidjeti koji se odlomci preklapaju umjesto da se oslanjate na ogoljeli broj.

Opseg i iskrenost ovdje su važni: ovo je alat za usporedbu dvaju tekstova, a ne detektor plagijata. Nema internetsku vezu, indeks pretraživanja niti bazu podataka tuđeg sadržaja za provjeru — može vam samo reći koliko su dva teksta koja zalijepite slična jedan drugome. To ga čini prikladnim za usporedbu nacrta revizija, provjeru koliko je parafraza ili prepravak zapravo promijenila, ili uočavanje gotovo dupliciranog sadržaja na vlastitim stranicama. Podudaranje riječi ne razlikuje velika i mala slova, a O(n·m) LCS tablica ograničena je na nekoliko milijuna ćelija parova riječi — za vrlo velike tekstove (otprilike nekoliko tisuća riječi ukupno) točan LCS i korak isticanja preskaču se uz obavijest na razumljivom jeziku, dok se Jaccardov rezultat n-grama, koji košta samo linearno vrijeme, uvijek izračunava na cijelom tekstu. Sve se izvodi lokalno u vašem pregledniku; nijedan tekst nikada ne napušta vaš uređaj.