Kontrola podobnosti textu
Porovnajte dva texty so skutočnou podobnosťou n-gramov Jaccard a skóre prekrývania LCS na úrovni slov, pričom zhodné pasáže sú zvýraznené vedľa seba.
Výsledok
Tento nástroj porovnáva dva texty, ktoré vložíte, pomocou dvoch nezávislých, skutočných, dobre zdokumentovaných algoritmov – nie je to vágna heuristika „vyzerá podobne“. Prvým je podobnosť n-gramu Jaccard: každý text sa tokenizuje na slová, potom sa rozdelí na prekrývajúce sa úseky n po sebe idúcich slov (n-gram; predvolená hodnota je n=3, trigram a môžete ho upraviť od 1 do 5). Jaccardov index dvoch výsledných n-gramových sád – veľkosť ich priesečníka vydelená veľkosťou ich spojenia – je štandardná miera podobnosti založená na súboroch používaná pri získavaní informácií a detekcii takmer duplicitných údajov. Vyššie n zachytáva dlhšie zdieľané frázovanie a je prísnejšie, pokiaľ ide o presné znenie; nižšie n je zhovievavejšie a zachytáva voľné prekrývanie slov aj medzi rôzne štruktúrovanými vetami.
Druhý algoritmus je skutočná Longest Common Subsequence (LCS) na úrovni slov, vypočítaná so skutočnou tabuľkou dynamického programovania O(n·m) pre dve sekvencie slov – ten istý učebnicový algoritmus, ktorý používajú nástroje rozdielov, nie aproximácia. Na rozdiel od n-gramového skóre, LCS nevyžaduje, aby zhodné slová boli súvislé, takže zachytáva prekrývanie aj vtedy, keď bola veta medzi zdieľanými frázami preusporiadaná alebo ľahko upravená. Percento prekrytia je odvodené z dĺžky LCS relatívne k priemernej dĺžke oboch textov. Tabuľka DP sa potom vráti späť, aby sa presne identifikovalo, ktoré slová v každom texte sa podieľali na tejto najdlhšej spoločnej sekvencii, a toto je výnimočná funkcia: tieto slová sa namapujú späť na váš pôvodný text – s pôvodnými medzerami, zalomením riadkov a interpunkciou – a vykreslia sa ako zvýraznené úseky vedľa seba, takže môžete presne vidieť, ktoré pasáže sa prekrývajú, namiesto toho, aby ste dôverovali holému číslu.
Tu záleží na rozsahu a poctivosti: toto je nástroj na porovnávanie dvoch textov, nie detektor plagiátov. Nemá žiadne internetové pripojenie, žiadny vyhľadávací index a žiadnu databázu obsahu iných ľudí, s ktorou by ste sa mohli porovnávať – môže vám len povedať, nakoľko sú si navzájom podobné dva texty, ktoré vložíte. Vďaka tomu je vhodný na porovnávanie revízií konceptov, kontrolu toho, do akej miery sa parafráza alebo prepis skutočne zmenili, alebo na zistenie takmer duplicitného obsahu na vašich vlastných stránkach. Pri zhode slov sa nerozlišujú malé a veľké písmená a tabuľka O(n·m) LCS je obmedzená na niekoľko miliónov buniek páru slov – pri veľmi veľkých textoch (zhruba niekoľko tisíc slov dohromady) sa presný krok LCS a zvýrazňovania preskočí poznámkou v obyčajnom jazyku, zatiaľ čo n-gramové skóre Jaccard, ktoré stojí iba lineárny čas, sa vždy počíta na celý text. Všetko beží lokálne vo vašom prehliadači; žiadny text nikdy neopustí vaše zariadenie.