Проверка на подобието на текст
Сравнете два текста с истинско n-грамово сходство на Jaccard и LCS резултат на припокриване на ниво дума, като съответстващите пасажи са маркирани един до друг.
Резултат
Този инструмент сравнява два текста, които поставяте, като използва два независими, реални, добре документирани алгоритъма — не неясна евристика „изглежда подобно“. Първият е n-gram Jaccard сходство: всеки текст се токенизира в думи, след което се разделя на припокриващи се серии от n последователни думи (n-gram; по подразбиране е n=3, триграма и можете да го коригирате от 1 до 5). Индексът на Jaccard на двата получени n-грам набора - размерът на тяхното пресичане, разделен на размера на тяхното обединение - е стандартна мярка за сходство, базирана на набор, използвана при извличане на информация и откриване на почти дублиране. По-високото n улавя по-дълги споделени фрази и е по-строго по отношение на точната формулировка; по-ниското n е по-прощаващо и улавя свободно припокриване на думи дори между различно структурирани изречения.
Вторият алгоритъм е истинска най-дълга обща подпоследователност (LCS) на ниво дума, изчислена с реална O(n·m) таблица за динамично програмиране върху двете последователности от думи — същият алгоритъм от учебника, използван от инструментите за разлики, а не приближение. За разлика от n-gram резултата, LCS не изисква съответстващите думи да са съседни, така че улавя припокриването дори когато изречение е пренаредено или леко редактирано между споделените фрази. Процентът на припокриване се извлича от дължината на LCS спрямо средната дължина на двата текста. След това DP таблицата се проследява назад, за да идентифицира точно кои думи във всеки текст са участвали в тази най-дълга обща последователност и това е отличителната характеристика: тези думи се нанасят обратно върху вашия оригинален текст — с непокътнати оригинални интервали, прекъсвания на редовете и пунктуация — и се изобразяват като подчертани участъци един до друг, така че можете да видите точно кои пасажи се припокриват, вместо да се доверявате на гол номер.
Тук има значение обхватът и честността: това е инструмент за сравнение на два текста, а не детектор за плагиатство. Той няма интернет връзка, няма индекс за търсене и няма база данни със съдържание на други хора, с което да се сравнява — може само да ви каже колко подобни са един на друг двата текста, които поставяте. Това го прави много подходящ за сравняване на чернови на ревизии, проверка на това доколко дадена парафраза или пренаписване действително се е променила или забелязване на почти дублирано съдържание на вашите собствени страници. Съвпадението на думи не е чувствително към малки и големи букви и таблицата O(n·m) LCS е ограничена до няколко милиона клетки за двойки думи — за много големи текстове (приблизително няколко хиляди думи комбинирани) точният LCS и стъпката за осветяване се пропускат с бележка на обикновен език, докато n-грам резултатът на Jaccard, който струва само линейно време, винаги се изчислява върху пълния текст. Всичко работи локално във вашия браузър; нито един текст никога не напуска вашето устройство.