0

Проверка на сходство на текстове

Сравнете два текста с реално сходство по Jaccard върху n-грами и оценка на припокриването чрез LCS на ниво дума, като съвпадащите пасажи са осветени едни до други.

🔒 Обработва се изцяло във вашия браузър - нищо, което въвеждате тук, никога не се качва.

Този инструмент сравнява само двата текста, които поставите тук — той няма интернет връзка, индекс за търсене или база данни със съдържание, затова не може да проверява за плагиатство спрямо други уеб страници. Съвпадението не прави разлика между малки и главни букви; пунктуацията и новите редове се игнорират при точкуването, но се запазват в осветения изглед по-долу.

Обработка... 0%
Разделяне на двата текста на отделни думи
Изчисляване на сходството по Jaccard чрез n-грами
Подравняване на текстовете чрез LCS на ниво дума
Визуализиране на осветените съвпадащи думи

Резултат

Този инструмент сравнява два текста, които поставите, използвайки два независими, реални, добре документирани алгоритъма — а не смътна евристика, че текстовете „изглеждат близки“. Първият е сходство по Jaccard чрез n-грами: всеки текст се разделя на думи, след което се нарязва на припокриващи се поредици от n последователни думи (n-грама; по подразбиране n=3, триграма, като можете да я настроите от 1 до 5). Индексът на Jaccard за получените две множества от n-грами — размерът на тяхното сечение, разделен на размера на тяхното обединение — е стандартна мярка за сходство на множества, използвана в извличането на информация и откриването на почти дублирани документи. По-високо n улавя по-дълги споделени фрази и е по-стриктно към точното изписване; по-ниско n е по-толерантно и улавя свободно припокриване на думи дори между различно структурирани изречения.

Вторият алгоритъм е истинска Най-дълга обща подредица (LCS) на ниво дума, изчислена с реална таблица на динамичното програмиране със сложност O(n·m) върху двете поредици от думи — същият класически алгоритъм, използван от diff инструментите, а не приближение. За разлика от оценката с n-грами, LCS не изисква съвпадналите думи да са последователни, затова улавя припокриване дори когато изречението е пренаредено или леко редактирано между споделените фрази. Процентът на припокриване се получава от дължината на LCS спрямо средната дължина на двата текста. След това таблицата на динамичното програмиране се проследява обратно, за да установи точно кои думи от всеки текст са участвали в тази най-дълга обща подредица, и това е отличителната характеристика: тези думи се нанасят обратно върху оригиналния ви текст — с непокътнати оригинални разстояния, нови редове и пунктуация — и се визуализират като осветени отрязъци един до друг, така че да видите точно кои пасажи се припокриват, вместо да разчитате само на число.

Тук обхватът и честността имат значение: това е инструмент за сравнение на два текста, а не детектор на плагиатство. Той няма интернет връзка, индекс за търсене и база данни с чуждо съдържание, с която да прави справка — може единствено да ви каже доколко сходни са двата текста, които сте поставили. Това го прави подходящ за сравняване на чернови редакции, проверка колко реално се е променил даден преразказ или пренаписване, или забелязване на почти дублирано съдържание в собствените ви страници. Съвпадението на думи не различава малки и главни букви, а таблицата за LCS с O(n·m) е ограничена до няколко милиона клетки от двойки думи — при много големи текстове (приблизително общо няколко хиляди думи) стъпката с точното LCS и осветяването се прескача с бележка на обикновен език, докато оценката с n-грами по Jaccard, която струва само линейно време, винаги се изчислява върху целия текст. Всичко работи локално във вашия браузър; нито един от текстовете не напуска устройството ви.