Перевірка схожості текстів
Порівняйте два тексти за справжньою n-грамною схожістю Жаккара та оцінкою збігу на основі LCS на рівні слів, з підсвічуванням однакових фрагментів поруч.
🔒 Обробляється повністю у вашому браузері — те, що ви тут вводите, ніколи не вивантажується.
Результат
Цей інструмент порівнює два вставлені вами тексти за двома незалежними, справжніми, добре задокументованими алгоритмами — а не за розмитою евристикою «начебто схоже». Перший — n-грамна схожість за Жаккаром: кожен текст розбивається на слова, потім формується у перекривні послідовності з n слів (n-грами; типово n=3, тобто триграми, а ви можете змінити значення від 1 до 5). Індекс Жаккара для двох отриманих множин n-грам — розмір їхнього перетину, поділений на розмір об’єднання — є стандартною мірою схожості на основі множин, яку використовують в інформаційному пошуку та виявленні майже дублікатів. Більше n краще вловлює довші спільні фрази та є суворішим до точного формулювання; менше n — більш поблажливе і знаходить вільні збіги слів навіть між реченнями з різною структурою.
Другий алгоритм — це справжня найдовша спільна підпослідовність (LCS) на рівні слів, обчислена за допомогою реальної таблиці динамічного програмування зі складністю O(n·m) для двох послідовностей слів — той самий класичний алгоритм, який використовують інструменти порівняння версій, а не наближення. На відміну від n-грамної оцінки, LCS не вимагає, щоб збіглі слова були суміжними, тому він виявляє перекриття, навіть якщо речення було переставлено або злегка відредаговано між спільними фразами. Відсоток збігу виводиться з довжини LCS відносно середньої довжини обох текстів. Потім таблиця динамічного програмування проходиться у зворотному напрямку, щоб точно визначити, які слова у кожному тексті увійшли до цієї найдовшої спільної послідовності, і це є визначною особливістю: ці слова проектуються назад на ваш оригінальний текст — зі збереженням оригінальних пробілів, розривів рядків і пунктуації — і відображаються як підсвічені фрагменти поруч, тож ви можете побачити, які саме уривки збігаються, замість того, щоб покладатися на голе число.
Тут важливі чесність і сфера застосування: це інструмент для порівняння двох текстів, а не детектор плагіату. Він не має підключення до інтернету, пошукового індексу чи бази даних чужого контенту для перевірки — він може лише визначити, наскільки схожі між собою два тексти, які ви вставили. Це робить його добре придатним для порівняння чернеток, перевірки того, наскільки змінився переказ або переписаний текст, чи виявлення майже дублікатів серед ваших власних сторінок. Зіставлення слів нечутливе до регістру, а таблиця LCS O(n·m) обмежена кількома мільйонами комірок пар слів — для дуже великих текстів (приблизно кілька тисяч слів разом) крок точного LCS і підсвічування пропускається зі зрозумілим повідомленням, тоді як n-грамна оцінка Жаккара, яка потребує лише лінійного часу, завжди обчислюється для повного тексту. Усе працює локально у вашому браузері; жоден текст не залишає вашого пристрою.