0

Kontrola podobnosti textů

Porovnejte dva texty pomocí Jaccardovy podobnosti pro n-gramy a skóre překryvu LCS na úrovni slov, se shodnými pasážemi zvýrazněnými vedle sebe.

🔒 Zpracováno výhradně ve vašem prohlížeči – nic, co zde zadáte, se nikdy nenahraje.

Tento nástroj porovnává pouze dva texty, které sem vložíte — nemá připojení k internetu, vyhledávací index ani databázi obsahu, takže nemůže kontrolovat plagiátorství vůči jiným webovým stránkám. Při porovnávání se nerozlišují velká a malá písmena; interpunkce a zalomení řádků se při bodování ignorují, ale v níže uvedeném zvýrazněném zobrazení jsou zachovány.

Zpracovává se... 0%
Tokenizace obou textů na slova
Výpočet Jaccardovy podobnosti pro n-gramy
Zarovnání textů pomocí LCS na úrovni slov
Vykreslení zvýraznění shodných slov

Výsledek

Tento nástroj porovnává dva vámi vložené texty pomocí dvou nezávislých, reálných a dobře zdokumentovaných algoritmů — nejde o žádnou vágní heuristiku typu „vypadá to podobně“. Prvním je Jaccardova podobnost pro n-gramy: každý text je tokenizován na slova a poté rozdělen na překrývající se úseky n po sobě jdoucích slov (n-gram; výchozí hodnota je n=3, trigram, a můžete ji nastavit od 1 do 5). Jaccardův index vzniklých dvou sad n-gramů — velikost jejich průniku dělená velikostí jejich sjednocení — je standardní množinovou mírou podobnosti používanou napříč vyhledáváním informací a detekcí blízkých duplikátů. Vyšší n zachytí delší sdílené fráze a je přísnější na přesné znění; nižší n je shovívavější a zachytí volný překryv slov i mezi rozdílně strukturovanými větami.

Druhý algoritmus je skutečná nejdelší společná podposloupnost (LCS) na úrovni slov, počítaná pomocí reálné tabulky dynamického programování se složitostí O(n·m) nad dvěma slovními posloupnostmi — stejným učebnicovým algoritmem, který používají diff nástroje, nikoli aproximací. Na rozdíl od n-gramového skóre LCS nevyžaduje, aby shodná slova byla souvislá, takže zachytí překryv, i když byla věta přeuspořádána nebo mezi sdílenými frázemi mírně upravena. Procento překryvu je odvozeno z délky LCS vzhledem k průměrné délce obou textů. Tabulka DP je poté zpětně prohledána, aby identifikovala přesně ta slova v každém textu, která se účastnila této nejdelší společné posloupnosti, a toto je výjimečná funkce: tato slova jsou mapována zpět do vašeho původního textu — s neporušenými původními mezerami, zalomeními řádků a interpunkcí — a vykreslena jako zvýrazněné úseky vedle sebe, takže přesně vidíte, které pasáže se překrývají, místo abyste museli věřit pouhému číslu.

Zde záleží na rozsahu a upřímnosti: toto je nástroj pro porovnání dvou textů, nikoli detektor plagiátů. Nemá připojení k internetu, žádný vyhledávací index ani databázi cizího obsahu, se kterou by texty srovnával — vždy může určit pouze to, jak jsou si dva vámi vložené texty podobné navzájem. To jej činí vhodným pro porovnávání revizí konceptů, kontrolu, jak moc se parafráze či přepis skutečně změnily, nebo odhalování téměř duplicitního obsahu napříč vašimi vlastními stránkami. Porovnávání slov nerozlišuje velikost písmen a tabulka LCS se složitostí O(n·m) je omezena na maximálně několik milionů buněk slovních párů — u velmi rozsáhlých textů (zhruba několik tisíc slov dohromady) je krok přesného LCS a zvýraznění přeskočen s prostou textovou poznámkou, zatímco n-gramové Jaccardovo skóre, které vyžaduje pouze lineární čas, je vždy spočítáno na celý text. Vše běží lokálně ve vašem prohlížeči; ani jeden z textů nikdy neopustí vaše zařízení.