Провера сличности текстова
Упоредите два текста користећи стварну Жакардову сличност n-грама и оцену преклапања на основу LCS на нивоу речи, са подударним одломцима истакнутим упоредо.
🔒 У потпуности се обрађује у вашем претраживачу — ништа што овде унесете се никада не отпрема.
Резултат
Ова алатка упоређује два текста која унесете коришћењем два независна, стварна, добро документована алгоритма — а не неке нејасне „изгледа слично” хеуристике. Први је Жакардова сличност n-грама: сваки текст се токенизује у речи, а затим дели на сегменте од n узастопних речи који се преклапају (n-грам; подразумевано је n=3, триграм, а можете га подесити од 1 до 5). Жакардов индекс добијених скупова n-грама — величина њиховог пресека подељена величином уније — стандардна је мера сличности заснована на скуповима, која се користи у проналажењу информација и откривању скоро дупликата. Веће n бележи дуже дељене фразе и строже је у погледу тачног израза; мање n је блаже и бележи лабавије преклапање речи чак и између различито структурираних реченица.
Други алгоритам је изворни најдужи заједнички подниз (LCS) на нивоу речи, израчунат помоћу стварне O(n·m) табеле динамичког програмирања над два низа речи — исти онај уџбенички алгоритам који користе алатке за diff, а не апроксимација. За разлику од оцене n-грама, LCS не захтева да подударне речи буду узастопне, па бележи преклапање чак и када је реченица преуређена или лагано измењена између дељених фраза. Проценат преклапања се изводи из дужине LCS у односу на просечну дужину оба текста. DP табела се затим ретроградно анализира да би се прецизно идентификовале речи у сваком тексту које учествују у том најдужем заједничком низу, и то је карактеристика која се издваја: те речи се пресликавају назад на ваш изворни текст — са нетакнутим изворним размаком, преломима редова и интерпункцијом — и приказују као истакнути сегменти упоредо, тако да можете тачно видети који одломци се преклапају, уместо да се ослањате на голи број.
Овде су обим и искреност важни: ово је алатка за поређење два текста, а не за детекцију плагијата. Нема интернет везу, претраживачки индекс нити базу података туђег садржаја за проверу — може само да вам каже колико су два текста која унесете међусобно слична. То је чини веома погодном за поређење верзија нацрта, проверу колико се парафраза или прерада заиста променила, или уочавање скоро дуплираног садржаја на сопственим страницама. Подударање речи не разликује велика и мала слова, а LCS табела O(n·m) је ограничена на неколико милиона ћелија парова речи — код веома великих текстова (отприлике неколико хиљада речи укупно) корак тачног LCS и истицања се прескаче уз јасну напомену, док се Жакардова оцена n-грама, која захтева само линеарно време, увек рачуна над целим текстом. Све ради локално у вашем прегледачу; текст никада не напушта ваш уређај.