Tekstide sarnasuse kontrollija
Võrdle kahte teksti, kasutades tegelikku n-grammi Jaccardi sarnasust ja sõnatasemelise LCS kattuvuse skoori, ning kattuvaid lõike tõstetakse kõrvuti esile.
🔒 Töödeldud täielikult teie brauseris – midagi, mida siia sisestate, ei laadita kunagi üles.
Tulemus
See tööriist võrdleb kahte siia kopeeritud teksti, kasutades kahte sõltumatut, tegelikku, hästi dokumenteeritud algoritmi — mitte udust „näib sarnane“ heuristikut. Esimene on n-grammi Jaccardi sarnasus: kumbki tekst jaotatakse sõnadeks ning seejärel lükatakse kattuvateks n järjestikuse sõna jadadeks (n-gramm; vaikimisi on n=3 ehk trigramm ja seda saab reguleerida vahemikus 1 kuni 5). Kahe tekkinud n-grammi hulga Jaccardi indeks — nende ühisosa suurus jagatud ühendi suurusega — on standardne hulkapõhine sarnasusmõõdik, mida kasutatakse infootsingus ja ligikaudse duplikaadi tuvastamises. Suurem n tabab pikemat ühist sõnastust ja on täpse sõnastuse suhtes rangem; väiksem n on leebem ja tabab lõdva sõnakattuvuse ka erineva ülesehitusega lausete vahel.
Teine algoritm on tegelik sõnatasemeline pikim ühine osasõne (LCS), mis arvutatakse tegeliku O(n·m) dünaamilise programmeerimise tabeliga kahe sõnajada jaoks — sama õpikualgoritm, mida kasutavad erinevuste leidmise (diff) tööriistad, mitte ligikaudne vaste. Erinevalt n-grammi skoorist ei nõua LCS, et sobivad sõnad oleksid järjestikku, mistõttu see tabab kattuvuse ka siis, kui lauseid on ümber sõnastatud või jagatud fraaside vahel on kergeid muudatusi. Kattuvuse protsent tuletatakse LCS pikkuse suhtest mõlema teksti keskmise pikkusega. DP tabelis tehakse seejärel tagasijälitus, et täpselt tuvastada, millised sõnad kummaski tekstis selles pikimas ühises osasõnes osalesid, ja see ongi silmapaistev omadus: need sõnad kaardistatakse tagasi sinu algsele tekstile — koos algsete tühikute, reavahede ja kirjavahemärkidega — ning renderdatakse kõrvuti esile tõstetud lõikudena, nii et saad täpselt näha, millised lõigud kattuvad, selle asemel et usaldada paljast numbrit.
Ulatus ja ausus on siinkohal olulised: see on kahe teksti võrdlemise tööriist, mitte plagiaadituvastaja. Sellel puudub internetiühendus, otsinguindeks ja teiste inimeste sisu andmebaas, millega võrrelda — see suudab ainult öelda, kui sarnased on kaks siia kopeeritud teksti omavahel. See teeb selle suurepäraselt sobivaks mustandite läbivaatamiseks, selle kontrollimiseks, kui palju ümbersõnastamine või -kirjutamine tegelikult muutis, või ligikaudu duplikaatse sisu märkamiseks sinu enda lehtedel. Sõnade vastavusse seadmine on tõstutundetu ja O(n·m) LCS tabel on piiratud mõne miljoni sõnapaari lahtriga — väga suurte tekstide (ligikaudu mõne tuhande sõna peale kokku) puhul jäetakse täpse LCS ja esiletõstmise samm vahele ning näidatakse arusaadavat märget, samas kui lineaarajas töötav n-grammi Jaccardi skoor arvutatakse alati kogu teksti kohta. Kõik toimub lokaalselt sinu brauseris; kumbki tekst ei lahku kunagi sinu seadmest.