0

Провера сличности текста

Упоредите два текста са стварном н-грамском Јаццард сличношћу и ЛЦС резултатом преклапања на нивоу речи, са одговарајућим одломцима истакнутим један поред другог.

Овај алат само упоређује два текста која овде налепите — нема интернет везу, индекс претраге или базу података садржаја, тако да не може да провери плагијат у односу на друге веб странице. Подударање је неосјетљиво на велика и мала слова; интерпункција и преломи редова се занемарују приликом бодовања, али се чувају у истакнутом приказу испод.

Buy Me a Coffee at ko-fi.com
Обрада... 0%
Токенизација оба текста у речи
Израчунавање сличности н-грама Јацкцарда
Усклађивање текстова са ЛЦС-ом на нивоу речи
Рендеровање истакнутих речи које се подударају

Резултат

Ова алатка упоређује два текста која налепите користећи два независна, стварна, добро документована алгоритма — а не нејасна хеуристика „изгледа слично“. Први је н-грамска сличност Јаццард-а: сваки текст се токенизује у речи, а затим се дели на низове који се преклапају од н узастопних речи (н-грам; подразумевано је н=3, триграм, и можете га подесити од 1 до 5). Жакардов индекс два резултујућа скупа н-грама — величина њиховог пресека подељена са величином њиховог споја — је стандардна мера сличности заснована на скупу која се користи за проналажење информација и детекцију скоро дупликата. Веће н хвата дуже заједничке фразе и строжије је у погледу тачних формулација; ниже н је попустљивије и хвата лабаво преклапање речи чак и између различито структурираних реченица.

Други алгоритам је оригинална најдужа заједничка подсеквенца (ЛЦС) на нивоу речи, израчуната са реалном О(н·м) табелом за динамичко програмирање преко две секвенце речи — исти алгоритам из уџбеника који користе дифф алати, а не апроксимација. За разлику од н-грамског резултата, ЛЦС не захтева да су упарене речи узастопне, тако да хвата преклапање чак и када је реченица промењена или лагано уређена између заједничких фраза. Проценат преклапања је изведен из дужине ЛЦС-а у односу на просечну дужину оба текста. ДП табела се затим враћа уназад да би се прецизно идентификовале које су речи у сваком тексту учествовале у том најдужем заједничком низу, а ово је изузетна карактеристика: те речи се мапирају назад на ваш оригинални текст — са нетакнутим оригиналним размаком, преломима редова и интерпункцијом — и приказују се као истакнути распони један поред другог, тако да можете да видите тачно који се одломци преклапају са бројем уместо броја.

Обим и искреност су овде важни: ово је алатка за поређење два текста, а не детектор плагијата. Нема интернет конекцију, индекс претраге и базу података о садржају других људи за проверу — може само да вам каже колико су два текста која налепите слична један другом. То га чини веома погодним за упоређивање нацрта ревизија, проверу колико се парафраза или преписивање заиста променило, или уочавање скоро дуплог садржаја на вашим страницама. Подударање речи је неосетљиво на велика и мала слова, а О(н·м) ЛЦС табела је ограничена на неколико милиона ћелија са паром речи — за веома велике текстове (комбиновано отприлике неколико хиљада речи) тачан корак ЛЦС и истицања се прескаче уз напомену на обичном језику, док је н-грамски Јаццард резултат, који увек кошта само линеарно време за цео текст, прескочен. Све ради локално у вашем претраживачу; ниједан текст никада не напушта ваш уређај.