Kontrola podobnosti textu
Porovnejte dva texty se skutečnou n-gramovou podobností Jaccard a skóre překrytí LCS na úrovni slov, se shodnými pasážemi zvýrazněnými vedle sebe.
Výsledek
Tento nástroj porovnává dva texty, které vložíte, pomocí dvou nezávislých, skutečných, dobře zdokumentovaných algoritmů – není to vágní heuristika „vypadá podobně“. První je podobnost s n-gramem Jaccard: každý text je rozdělen na slova a poté rozdělen do překrývajících se úseků n po sobě jdoucích slov (n-gram; výchozí hodnota je n=3, trigram a můžete jej upravit od 1 do 5). Jaccardův index dvou výsledných n-gramových množin – velikost jejich průsečíku dělená velikostí jejich spojení – je standardní míra podobnosti založená na množinách, která se používá při vyhledávání informací a detekci téměř duplicit. Vyšší n zachytí delší sdílené frázování a je přísnější, pokud jde o přesné znění; nižší n je shovívavější a zachytí volné překrývání slov i mezi různě strukturovanými větami.
Druhý algoritmus je skutečná Longest Common Subsequence (LCS) na úrovni slov, počítaná se skutečnou O(n·m) tabulkou dynamického programování přes dvě posloupnosti slov – stejný učebnicový algoritmus, který používají nástroje diff, nikoli aproximace. Na rozdíl od n-gramového skóre LCS nevyžaduje, aby shodná slova byla souvislá, takže zachycuje překrývání, i když byla věta mezi sdílenými frázemi přeuspořádána nebo lehce upravena. Procento překrytí je odvozeno z délky LCS vzhledem k průměrné délce obou textů. Tabulka DP je poté zpětně sledována, aby bylo možné přesně identifikovat, která slova v každém textu se účastnila této nejdelší společné sekvence, a to je vynikající funkce: tato slova jsou namapována zpět na váš původní text – s původními mezerami, zalomením řádků a interpunkcí – a vykreslena jako zvýrazněné úseky vedle sebe, takže můžete přesně vidět, které pasáže se překrývají, místo abyste důvěřovali holému číslu.
Zde záleží na rozsahu a poctivosti: jedná se o nástroj pro porovnání dvou textů, nikoli o detektor plagiátů. Nemá žádné připojení k internetu, žádný vyhledávací index a žádnou databázi obsahu jiných lidí, se kterou by se dalo porovnat – může vám pouze říci, jak podobné jsou si dva texty, které vložíte, navzájem. Díky tomu se dobře hodí k porovnávání revizí konceptů, kontrole, jak moc se parafráze nebo přepis skutečně změnily, nebo k nalezení téměř duplicitního obsahu na vašich vlastních stránkách. Porovnávání slov nerozlišuje velká a malá písmena a tabulka O(n·m) LCS je omezena na několik milionů buněk páru slov – u velmi rozsáhlých textů (zhruba několik tisíc slov dohromady) se přesný krok LCS a zvýraznění přeskakuje poznámkou v prostém jazyce, zatímco n-gramové skóre Jaccard, které stojí pouze lineární čas, se vždy vypočítává pro celý text. Vše běží lokálně ve vašem prohlížeči; žádný text nikdy neopustí vaše zařízení.