Tekstin samankaltaisuuden tarkistus
Vertaa kahta tekstiä, joissa on todellinen n-grammin Jaccard-samankaltaisuus ja sanatason LCS-päällekkäisyyspisteet, niin että vastaavat kohdat on korostettu vierekkäin.
Tulos
Tämä työkalu vertaa kahta liittämääsi tekstiä käyttämällä kahta itsenäistä, todellista, hyvin dokumentoitua algoritmia – ei epämääräistä "näyttää samanlaiselta" heuristiikkaa. Ensimmäinen on n-grammien Jaccard-samankaltaisuus: jokainen teksti muunnetaan sanoiksi, sitten jaetaan päällekkäisiksi n:n peräkkäisen sanan sarjaksi (n-grammi; oletusarvo on n=3, trigrammi, ja voit säätää sitä 1:stä 5:een). Kahden tuloksena olevan n-grammijoukon Jaccard-indeksi – niiden leikkauspisteen koko jaettuna niiden liiton koolla – on standardi joukkoon perustuva samankaltaisuusmitta, jota käytetään tiedonhaussa ja lähes kaksoiskappaleiden havaitsemisessa. Korkeampi n saa kiinni pidemmän jaetun ilmaisun ja on tiukempi tarkan sanamuodon suhteen; alempi n on anteeksiantavampi ja tarttuu löysästi päällekkäisyyteen jopa eri tavoin rakenteellisten lauseiden välillä.
Toinen algoritmi on aito sanatason Longest Common Subsequence (LCS), joka on laskettu todellisella O(n·m) dynaamisella ohjelmointitaulukolla kahdelle sanasarjalle – sama oppikirjaalgoritmi, jota diff-työkalut käyttävät, ei likiarvo. Toisin kuin n-grammien pisteet, LCS ei vaadi vastaavien sanojen olevan vierekkäisiä, joten se kaappaa päällekkäisyydet, vaikka lause olisi järjestetty uudelleen tai muokattu kevyesti jaettujen lauseiden välillä. Päällekkäisyysprosentti on johdettu LCS-pituudesta suhteessa molempien tekstien keskimääräiseen pituuteen. Tämän jälkeen DP-taulukkoa ajetaan taaksepäin, jotta voidaan tunnistaa tarkasti, mitkä sanat kussakin tekstissä osallistuivat pisimpään yhteiseen sarjaan, ja tämä on erottuva ominaisuus: nämä sanat kartoitetaan takaisin alkuperäiseen tekstiisi – alkuperäisen välin, rivinvaihdon ja välimerkkien ennallaan – ja hahmonnetaan korostettuina jänteinä vierekkäin, joten näet tarkalleen, mitkä kohdat menevät päällekkäin sen sijaan, että luotat paljousnumeroon.
Laajuus ja rehellisyys ovat tärkeitä: tämä on kahden tekstin vertailutyökalu, ei plagioinnin ilmaisin. Sillä ei ole Internet-yhteyttä, hakuhakemistoa eikä tietokantaa muiden ihmisten sisällöstä, jota voitaisiin verrata – se voi vain kertoa, kuinka samankaltaisia liittämäsi tekstit ovat keskenään. Tämän ansiosta se sopii hyvin luonnosten versioiden vertailuun, sen tarkistamiseen, kuinka paljon parafraasi tai uudelleenkirjoitus todella muuttui, tai lähes päällekkäisen sisällön havaitsemiseen omilla sivuillasi. Sanojen vastaavuudessa kirjainkoolla ei ole merkitystä, ja O(n·m) LCS-taulukon enimmäismäärä on muutama miljoona sanaparisolua – erittäin suurissa teksteissä (noin muutama tuhat sanaa yhteensä) tarkka LCS- ja korostusvaihe ohitetaan selväkielisellä huomautuksella, kun taas n-gramman Jaccard-pisteet, jotka maksavat vain lineaarista aikaa, lasketaan aina koko tekstistä. Kaikki toimii paikallisesti selaimessasi; kumpikaan teksti ei koskaan poistu laitteestasi.