0

Porównywarka podobieństwa tekstów

Porównaj dwa teksty za pomocą rzeczywistego podobieństwa n-gramów Jaccarda i wskaźnika pokrycia LCS na poziomie słów, z podświetlonymi obok siebie pasażami.

🔒 Przetwarzane w całości w Twojej przeglądarce — nic, co tu wpiszesz, nie zostanie nigdy przesłane.

To narzędzie porównuje tylko dwa wklejone tutaj teksty — nie ma połączenia z internetem, indeksu wyszukiwania ani bazy treści, więc nie może sprawdzać plagiatów względem innych stron internetowych. Porównanie nie uwzględnia wielkości liter; znaki interpunkcyjne i podziały wierszy są ignorowane podczas oceniania, ale zachowywane w widoku z podświetleniami poniżej.

Przetwarzanie... 0%
Tokenizacja obu tekstów na słowa
Obliczanie podobieństwa n-gramów metodą Jaccarda
Dopasowywanie tekstów za pomocą LCS na poziomie słów
Renderowanie podświetleń dopasowanych słów

Wynik

To narzędzie porównuje dwa wklejone przez Ciebie teksty, używając dwóch niezależnych, rzeczywistych i dobrze udokumentowanych algorytmów – a nie mglistej heurystyki "wygląda podobnie". Pierwszym z nich jest podobieństwo n-gramów Jaccarda: każdy tekst jest tokenizowany na słowa, a następnie dzielony na nachodzące ciągi n kolejnych słów (n-gram; domyślnie n=3, trygram, który można regulować w zakresie od 1 do 5). Wskaźnik Jaccarda dla dwóch powstałych zbiorów n-gramów – rozmiar ich części wspólnej podzielony przez rozmiar ich sumy – jest standardową, zbiorczą miarą podobieństwa stosowaną w wyszukiwaniu informacji i wykrywaniu duplikatów. Wyższe n wychwytuje dłuższe wspólne sformułowania i jest bardziej restrykcyjne co do dokładnego sformułowania; niższe n jest bardziej wyrozumiałe i wyłapuje luźne pokrywanie się słów nawet między zdaniami o różnej strukturze.

Drugim algorytmem jest autentyczny Najdłuższy Wspólny Podciąg (LCS) na poziomie słów, obliczany za pomocą prawdziwej tablicy programowania dynamicznego o złożoności O(n·m) na dwóch sekwencjach słów – ten sam podręcznikowy algorytm używany przez narzędzia diff, a nie przybliżenie. W przeciwieństwie do wyniku n-gramów, LCS nie wymaga, aby dopasowane słowa były ciągłe, więc wychwytuje pokrywanie się nawet wtedy, gdy zdanie zostało przestawione lub lekko zredagowane pomiędzy wspólnymi frazami. Procent pokrycia jest wyprowadzany z długości LCS w stosunku do średniej długości obu tekstów. Tablica DP jest następnie odtwarzana wstecz, aby precyzyjnie wskazać, które słowa w każdym tekście wchodziły w skład tego najdłuższego wspólnego podciągu, i to jest wyróżniająca cecha: te słowa są mapowane z powrotem na Twój oryginalny tekst – z zachowaniem oryginalnych odstępów, podziałów wierszy i interpunkcji – i renderowane jako podświetlone fragmenty obok siebie, dzięki czemu możesz dokładnie zobaczyć, które pasażę się pokrywają, zamiast ufać pojedynczej liczbie.

Zakres i uczciwość mają tutaj znaczenie: jest to narzędzie do porównywania dwóch tekstów, a nie wykrywacz plagiatów. Nie ma połączenia z internetem, indeksu wyszukiwania ani bazy treści innych osób do sprawdzenia – może jedynie stwierdzić, jak podobne są do siebie dwa wklejone przez Ciebie teksty. Dzięki temu doskonale nadaje się do porównywania wersji roboczych, sprawdzania, jak bardzo parafraza lub przeróbka faktycznie się zmieniła, lub wykrywania niemal identycznych treści na własnych stronach. Dopasowywanie słów nie uwzględnia wielkości liter, a tablica LCS o złożoności O(n·m) jest ograniczona do kilku milionów komórek par słów – w przypadku bardzo dużych tekstów (w przybliżeniu łączna liczba kilku tysięcy słów) dokładne wyznaczanie LCS i podświetlanie jest pomijane z wyraźną informacją, natomiast wskaźnik Jaccarda dla n-gramów, który ma jedynie koszt liniowy, jest zawsze obliczany dla całego tekstu. Wszystko działa lokalnie w Twojej przeglądarce; żaden tekst nigdy nie opuszcza Twojego urządzenia.