0

Szöveghasonlóság-ellenőrző

Hasonlítson össze két szöveget valódi n-gramos Jaccard-hasonlósággal és szószintű LCS-átfedési pontszámmal, a megfelelő szövegrészeket egymás mellett kiemelve.

Ez az eszköz csak az ide beillesztett két szöveget hasonlítja össze – nincs internetkapcsolata, keresési indexe vagy tartalmi adatbázisa, így nem tudja ellenőrizni a plágiumot más weboldalakon. Az egyeztetés nem tesz különbséget a kis- és nagybetűk között; pontozáskor figyelmen kívül hagyja az írásjeleket és a sortöréseket, de az alábbi kiemelt nézetben megmarad.

Buy Me a Coffee at ko-fi.com
Feldolgozás... 0%
Mindkét szöveg szavakká formálása
Az n-gramm Jaccard hasonlóság kiszámítása
Szövegek igazítása szószintű LCS-hez
Egyező szó kiemelések megjelenítése

Eredmény

Ez az eszköz összehasonlítja a beillesztett két szöveget két független, valódi, jól dokumentált algoritmus segítségével – nem egy homályos „hasonlóan néz ki” heurisztika. Az első az n-grammos Jaccard hasonlóság: minden szöveget szavakká alakítanak, majd n egymást követő szóból álló egymást átfedő sorozatokra osztják (egy n-gramm; az alapértelmezett n=3, egy trigram, és 1-től 5-ig módosítható). A két eredményül kapott n-gramos halmaz Jaccard-indexe – metszéspontjuk mérete osztva az egyesülésük méretével – egy szabványos halmazalapú hasonlósági mérőszám, amelyet információ-visszakeresésben és majdnem ismétlődő észlelésben használnak. A magasabb n megfogja a hosszabb megosztott kifejezéseket, és szigorúbb a pontos megfogalmazást illetően; az alacsonyabb n megbocsátóbb, és még a különböző szerkezetű mondatok között is megragadja a laza szóátfedést.

A második algoritmus egy valódi szószintű leghosszabb közös részsorozat (LCS), amelyet egy valós O(n·m) dinamikus programozási táblázattal számítanak ki a két szósorozaton keresztül – ugyanaz a tankönyvi algoritmus, amelyet a diff eszközök is használnak, nem pedig közelítés. Az n-gramos pontszámtól eltérően az LCS nem követeli meg, hogy az egyező szavak egymás mellett legyenek, így akkor is rögzíti az átfedést, ha a mondatot átrendezték vagy enyhén szerkesztették a megosztott kifejezések között. Az átfedés százaléka az LCS hosszából származik mindkét szöveg átlagos hosszához viszonyítva. A DP-táblázat ezután visszafelé halad, hogy pontosan azonosítsa, az egyes szövegek szavai vettek részt a leghosszabb közös sorozatban, és ez a kiemelkedő jellemző: ezek a szavak vissza lesznek képezve az eredeti szövegbe – az eredeti térközök, sortörések és írásjelek érintetlenek maradnak –, és egymás mellett kiemelve jelennek meg, így pontosan láthatja, hogy mely szövegrészek fedik egymást, ahelyett, hogy egy sorszámot bízna.

Itt a terjedelem és az őszinteség számít: ez egy kétszöveges összehasonlító eszköz, nem plágiumdetektor. Nincs internetkapcsolata, nincs keresési indexe, és nincs adatbázisa mások tartalmairól, amelyeket ellenőrizni lehetne – csak azt tudja megmondani, mennyire hasonlít egymáshoz a két beillesztett szöveg. Ez alkalmassá teszi a változatok vázlatainak összehasonlítására, annak ellenőrzésére, hogy egy parafrázis vagy átírás valójában mennyit változott, vagy szinte ismétlődő tartalom észlelésére saját oldalain. A szóillesztés nem tesz különbséget a kis- és nagybetűk között, és az O(n·m) LCS tábla néhány millió szópár cellában van maximálva – nagyon nagy szövegeknél (nagyjából néhány ezer szó együtt) a pontos LCS és kiemelési lépést egy egyszerű nyelvű jegyzet kihagyja, míg az n-grammos Jaccard pontszámot, amely csak lineáris időbe kerül, mindig a teljes szövegen számítja ki. Minden helyileg fut a böngészőben; egyik szöveg sem hagyja el a készüléket.