Tekstien samankaltaisuuden tarkistaja
Vertaa kahta tekstiä aidolla n-grammin Jaccard-samankaltaisuudella ja sanatason LCS-päällekkäisyyspisteillä, ja vastaavat kohdat korostetaan rinnakkain.
🔒 Käsitelty kokonaan selaimessasi – mitään tähän kirjoittamaasi ei koskaan ladata.
Tulos
Tämä työkalu vertailee kahta liittämääsi tekstiä käyttäen kahta itsenäistä, aitoa ja hyvin dokumentoitua algoritmia — ei epämääräistä 'näyttää samanlaiselta' -heuristiikkaa. Ensimmäinen on n-grammien Jaccard-samankaltaisuus: kumpikin teksti jaetaan sanoiksi, minkä jälkeen sanat jaetaan n:n peräkkäisen sanan mittaisiksi limittäisiksi jaksoiksi (n-grammi; oletus on n=3 eli trigrammi, ja voit säätää arvoa 1:stä 5:een). Näin saatujen kahden n-grammijoukon Jaccard-indeksi — joukkojen leikkauksen koko jaettuna unionin koolla — on vakiintunut joukkoihin perustuva samankaltaisuusmitta, jota käytetään tiedonhaussa ja lähimuotoisten tekstien tunnistuksessa. Suurempi n:n arvo havaitsee pidempiä yhteisiä sanontoja ja on tiukempi tarkan sanamuodon suhteen; pienempi n:n arvo on anteeksiantavampi ja havaitsee löyhiä sanapäällekkäisyyksiä myös eri tavoin jäsenneltyjen lauseiden välillä.
Toinen algoritmi on aito sanatason pisin yhteinen alijono (LCS), joka lasketaan aidolla O(n·m)-aikaisella dynaamisen ohjelmoinnin taululla kahden sanajonon välillä — sama oppikirja-algoritmi, jota diff-työkalut käyttävät, ei mikään likiarvo. Toisin kuin n-grammipistemäärä, LCS ei edellytä vastaavien sanojen olevan peräkkäin, joten se havaitsee päällekkäisyyden silloinkin, kun lause on järjestetty uudelleen tai sitä on kevyesti muokattu yhteisten fraasien välissä. Päällekkäisyysprosentti muodostetaan LCS:n pituudesta suhteessa molempien tekstien keskipituuteen. Tämän jälkeen DP-taulua peruutetaan, jotta voidaan tunnistaa tarkalleen, mitkä sanat kummassakin tekstissä olivat osa pisintä yhteistä alijonoa, ja tässä on työkalun erottuva ominaisuus: kyseiset sanat kartoitetaan takaisin alkuperäiseen tekstiisi — alkuperäisine väleinen, rivinvaihtoineen ja välimerkkeineen — ja piirretään korostettuina jaksoina rinnakkain, joten näet tarkalleen, mitkä kohdat ovat päällekkäin, sen sijaan, että luottaisit paljaaseen numeroon.
Laajuus ja rehellisyys ovat tässä tärkeitä: kyseessä on kahden tekstin vertailutyökalu, ei plagiaatintunnistin. Sillä ei ole internetyhteyttä, ei hakemistoa eikä tietokantaa muiden ihmisten sisällöistä, joihin tekstejä verrattaisiin — se voi ainoastaan kertoa, kuinka samankaltaisia kaksi liittämääsi tekstiä ovat keskenään. Tämä tekee siitä hyvän työkalun luonnosten versioiden vertailuun, sen tarkistamiseen, kuinka paljon parafraasi tai uudelleenkirjoitus todellisuudessa muuttui, tai lähes identtisten sisältöjen havaitsemiseen omilla sivuillasi. Sanojen vastaavuusvertailu on kirjainkoosta riippumaton, ja O(n·m)-aikainen LCS-taulukko on rajattu enintään muutamaan miljoonaan sanaparisoluun — erittäin suurten tekstien kohdalla (yhdistettynä noin muutama tuhat sanaa) tarkka LCS- ja korostusvaihe ohitetaan selväkielisellä huomiolla, kun taas n-grammien Jaccard-pistemäärä, joka vaatii vain lineaarisen ajan, lasketaan aina koko tekstistä. Kaikki tapahtuu paikallisesti selaimessasi; kumpikaan teksti ei koskaan poistu laitteeltasi.