0

Kontrola podobnosti textu

Porovnejte dva texty se skutečnou n-gramovou podobností Jaccard a skóre překrytí LCS na úrovni slov, se shodnými pasážemi zvýrazněnými vedle sebe.

Tento nástroj porovnává pouze dva texty, které sem vložíte – nemá připojení k internetu, vyhledávací index ani databázi obsahu, takže nemůže kontrolovat plagiát s jinými webovými stránkami. Párování nerozlišuje velká a malá písmena; interpunkce a zalomení řádků jsou při bodování ignorovány, ale zachovány ve zvýrazněném zobrazení níže.

Buy Me a Coffee at ko-fi.com
Zpracování... 0%
Tokenizace obou textů do slov
Výpočet podobnosti n-gram Jaccard
Zarovnání textů s LCS na úrovni slova
Vykreslování zvýraznění shodných slov

Výsledek

Tento nástroj porovnává dva texty, které vložíte, pomocí dvou nezávislých, skutečných, dobře zdokumentovaných algoritmů – není to vágní heuristika „vypadá podobně“. První je podobnost s n-gramem Jaccard: každý text je rozdělen na slova a poté rozdělen do překrývajících se úseků n po sobě jdoucích slov (n-gram; výchozí hodnota je n=3, trigram a můžete jej upravit od 1 do 5). Jaccardův index dvou výsledných n-gramových množin – velikost jejich průsečíku dělená velikostí jejich spojení – je standardní míra podobnosti založená na množinách, která se používá při vyhledávání informací a detekci téměř duplicit. Vyšší n zachytí delší sdílené frázování a je přísnější, pokud jde o přesné znění; nižší n je shovívavější a zachytí volné překrývání slov i mezi různě strukturovanými větami.

Druhý algoritmus je skutečná Longest Common Subsequence (LCS) na úrovni slov, počítaná se skutečnou O(n·m) tabulkou dynamického programování přes dvě posloupnosti slov – stejný učebnicový algoritmus, který používají nástroje diff, nikoli aproximace. Na rozdíl od n-gramového skóre LCS nevyžaduje, aby shodná slova byla souvislá, takže zachycuje překrývání, i když byla věta mezi sdílenými frázemi přeuspořádána nebo lehce upravena. Procento překrytí je odvozeno z délky LCS vzhledem k průměrné délce obou textů. Tabulka DP je poté zpětně sledována, aby bylo možné přesně identifikovat, která slova v každém textu se účastnila této nejdelší společné sekvence, a to je vynikající funkce: tato slova jsou namapována zpět na váš původní text – s původními mezerami, zalomením řádků a interpunkcí – a vykreslena jako zvýrazněné úseky vedle sebe, takže můžete přesně vidět, které pasáže se překrývají, místo abyste důvěřovali holému číslu.

Zde záleží na rozsahu a poctivosti: jedná se o nástroj pro porovnání dvou textů, nikoli o detektor plagiátů. Nemá žádné připojení k internetu, žádný vyhledávací index a žádnou databázi obsahu jiných lidí, se kterou by se dalo porovnat – může vám pouze říci, jak podobné jsou si dva texty, které vložíte, navzájem. Díky tomu se dobře hodí k porovnávání revizí konceptů, kontrole, jak moc se parafráze nebo přepis skutečně změnily, nebo k nalezení téměř duplicitního obsahu na vašich vlastních stránkách. Porovnávání slov nerozlišuje velká a malá písmena a tabulka O(n·m) LCS je omezena na několik milionů buněk páru slov – u velmi rozsáhlých textů (zhruba několik tisíc slov dohromady) se přesný krok LCS a zvýraznění přeskakuje poznámkou v prostém jazyce, zatímco n-gramové skóre Jaccard, které stojí pouze lineární čas, se vždy vypočítává pro celý text. Vše běží lokálně ve vašem prohlížeči; žádný text nikdy neopustí vaše zařízení.