0

Szöveg-összehasonlító

Hasonlítson össze két szöveget valódi n-grammos Jaccard-hasonlósággal és szószintű LCS-átfedési pontszámmal, az egyező részek egymás melletti kiemelésével.

🔒 Teljesen a böngészőjében dolgozzák fel – soha semmi, amit itt beírt, nem kerül feltöltésre.

Ez az eszköz kizárólag az Ön által ide beillesztett két szöveget hasonlítja össze — nincs internetkapcsolata, keresési indexe vagy tartalom-adatbázisa, így nem tud plágiumot ellenőrizni más weboldalakkal szemben. Az illesztés kis- és nagybetűérzéketlen; az írásjelek és a sortörések figyelmen kívül vannak hagyva a pontozáskor, de megőrződnek a lenti kiemelt nézetben.

Feldolgozás... 0%
Mindkét szöveg szavakra bontása (tokenizálás)
N-grammos Jaccard-hasonlóság számítása
Szövegek illesztése szószintű LCS-sel
Illeszkedő szavak kiemelésének megjelenítése

Eredmény

Ez az eszköz az Ön által beillesztett két szöveget két független, valódi, jól dokumentált algoritmussal hasonlítja össze — nem egy homályos „hasonlítanak” heurisztikával. Az első az n-grammos Jaccard-hasonlóság: minden szöveg szavakra van bontva, majd n egymást követő szóból álló átfedő csoportokra (n-grammokra) osztva (az alapértelmezett n=3, azaz trigramm, és ez 1-től 5-ig állítható). A két keletkező n-gramm halmaz Jaccard-indexe — a metszetük mérete osztva az uniójuk méretével — egy standard halmazalapú hasonlósági mérték, amelyet az információkeresésben és a közel duplikátumok észlelésében használnak. A magasabb n hosszabb közös megfogalmazásokat fog meg, és szigorúbb a pontos szóhasználathoz; az alacsonyabb n megengedőbb, és laza szóátfedést is fog még az eltérően szerkesztett mondatok között is.

A második algoritmus egy valódi szószintű leghosszabb közös részsorozat (LCS), amelyet egy valós O(n·m) futásidejű dinamikusprogramozás-táblázattal számolunk ki a két szósorozat felett — ugyanaz a tankönyvi algoritmus, amit a diff eszközök használnak, nem közelítés. Az n-gramm pontszámmal ellentétben az LCS nem követeli meg, hogy az illeszkedő szavak folytonosak legyenek, így akkor is rögzíti az átfedést, ha egy mondatot átrendeztek vagy enyhén átszerkesztettek a közös kifejezések között. Az átfedési százalék az LCS hosszából származik a két szöveg átlagos hosszához viszonyítva. A DP-táblát ezután visszakövetjük, hogy azonosítsuk pontosan azokat a szavakat mindkét szövegben, amelyek részt vettek abban a leghosszabb közös sorozatban, és ez a kiemelkedő tulajdonság: ezek a szavak vissza vannak képezve az Ön eredeti szövegére — annak eredeti szóközeivel, sortöréseivel és írásjeleivel együtt —, és kiemelt részekként jelennek meg egymás mellett, így pontosan láthatja, mely részek fedik egymást, ahelyett, hogy egy puszta számban bízna.

Itt fontos a hatókör és az őszinteség: ez egy kétszöveges összehasonlító eszköz, nem plágiumdetektor. Nincs internetkapcsolata, keresési indexe és mások tartalmát tartalmazó adatbázisa, amellyel ellenőrizhetne — csak azt tudja megmondani, hogy az Ön által beillesztett két szöveg mennyire hasonlít egymásra. Ez alkalmassá teszi vázlatátdolgozások összehasonlítására, annak ellenőrzésére, hogy egy átfogalmazás vagy átírás mennyit változtatott, vagy közel azonos tartalom felfedezésére a saját oldalain. A szóillesztés kis- és nagybetűérzéketlen, az O(n·m)-es LCS-tábla pedig néhány millió szópár cellára van korlátozva — nagyon nagy szövegek esetén (nagyjából összesen néhány ezer szó) a pontos LCS és a kiemelési lépés kimarad egy közérthető megjegyzéssel, míg az n-grammos Jaccard-pontszám, amely csak lineáris időt vesz igénybe, mindig kiszámításra kerül a teljes szövegre. Minden helyben, az Ön böngészőjében fut; egyik szöveg sem hagyja el az eszközét.