0

Sprawdzanie podobieństwa tekstu

Porównaj dwa teksty z prawdziwym n-gramowym podobieństwem Jaccarda i wynikiem nakładania się LCS na poziomie słów, z pasującymi fragmentami wyróżnionymi obok siebie.

To narzędzie porównuje jedynie dwa teksty, które tu wkleisz — nie ma połączenia z Internetem, indeksu wyszukiwania ani bazy danych treści, więc nie może sprawdzać pod kątem plagiatu na innych stronach internetowych. W dopasowywaniu nie jest rozróżniana wielkość liter; znaki interpunkcyjne i podziały wierszy są ignorowane podczas oceniania, ale zachowywane w wyróżnionym widoku poniżej.

Buy Me a Coffee at ko-fi.com
Przetwarzanie... 0%
Tokenizowanie obu tekstów na słowa
Obliczanie n-gramowego podobieństwa Jaccarda
Wyrównywanie tekstów za pomocą LCS na poziomie słów
Renderowanie wyróżnień dopasowanych słów

Wynik

To narzędzie porównuje dwa wklejone teksty przy użyciu dwóch niezależnych, prawdziwych, dobrze udokumentowanych algorytmów — a nie niejasnej heurystyki „wygląda podobnie”. Pierwszym z nich jest n-gramowe podobieństwo Jaccarda: każdy tekst jest dzielony na słowa, a następnie dzielony na nakładające się ciągi n kolejnych słów (n-gram; wartość domyślna to n=3, trygram, którą można dostosować od 1 do 5). Indeks Jaccarda dwóch powstałych n-gramowych zbiorów — wielkość ich przecięcia podzielona przez wielkość ich sumy — jest standardową miarą podobieństwa opartą na zbiorach, stosowaną podczas wyszukiwania informacji i wykrywania niemal duplikatów. Wyższe n obejmuje dłuższe wspólne sformułowania i jest bardziej rygorystyczne pod względem dokładnego sformułowania; niższe n jest bardziej wyrozumiałe i wychwytuje luźne nakładanie się słów nawet pomiędzy zdaniami o różnej strukturze.

Drugi algorytm to najdłuższa wspólna podsekwencja (LCS) na poziomie słów, obliczona przy użyciu rzeczywistej tabeli programowania dynamicznego O(n·m) dla dwóch sekwencji słów — ten sam podręcznikowy algorytm używany przez narzędzia różnicujące, a nie przybliżenie. W przeciwieństwie do wyniku n-gramowego, LCS nie wymaga, aby dopasowane słowa sąsiadowały ze sobą, więc wychwytuje nakładanie się nawet wtedy, gdy zdanie zostało zmienione lub nieznacznie zmodyfikowane pomiędzy udostępnionymi frazami. Procent nakładania się jest obliczany na podstawie długości LCS w stosunku do średniej długości obu tekstów. Następnie tabela DP jest cofana, aby dokładnie określić, które słowa w każdym tekście brały udział w najdłuższej wspólnej sekwencji, i jest to wyjątkowa funkcja: te słowa są mapowane z powrotem na oryginalny tekst – z nienaruszonymi oryginalnymi odstępami, podziałami wierszy i interpunkcją – i renderowane jako wyróżnione zakresy obok siebie, dzięki czemu możesz dokładnie zobaczyć, które fragmenty się pokrywają, zamiast ufać samej liczbie.

Zakres i uczciwość mają tutaj znaczenie: jest to narzędzie do porównywania dwóch tekstów, a nie wykrywacz plagiatów. Nie ma połączenia z Internetem, indeksu wyszukiwania ani bazy danych zawierającej treści innych osób, z którą można by sprawdzić — może jedynie stwierdzić, jak podobne są do siebie dwa wklejone teksty. Dzięki temu dobrze nadaje się do porównywania wersji roboczych, sprawdzania, jak bardzo parafraza lub przepisanie faktycznie się zmieniło, lub wykrywania niemal zduplikowanych treści na własnych stronach. Dopasowywanie słów nie uwzględnia wielkości liter, a tabela O(n·m) LCS jest ograniczona do kilku milionów komórek składających się z par słów — w przypadku bardzo dużych tekstów (łącznie około kilku tysięcy słów) dokładny etap LCS i wyróżniania jest pomijany za pomocą notatki w prostym języku, podczas gdy n-gramowa ocena Jaccarda, która kosztuje tylko czas liniowy, jest zawsze obliczana na pełnym tekście. Wszystko działa lokalnie w Twojej przeglądarce; żaden tekst nigdy nie opuszcza Twojego urządzenia.