Teksta līdzības pārbaudītājs
Salīdziniet divus tekstus ar īstu n-gramu Jaccard līdzību un vārdu līmeņa LCS pārklāšanās punktu skaitu, izceļot atbilstošos fragmentus blakus.
Rezultāts
Šis rīks salīdzina divus tekstus, kurus ielīmējat, izmantojot divus neatkarīgus, reālus, labi dokumentētus algoritmus — nevis neskaidru heiristisku “izskatās līdzīgi”. Pirmā ir n-gramu Jaccard līdzība: katrs teksts tiek pārveidots vārdos, pēc tam sadalīts n secīgu vārdu sērijās, kas pārklājas (n-gram; noklusējuma vērtība ir n=3, trigramma, un jūs varat to pielāgot no 1 līdz 5). Divu iegūto n-gramu kopu Žakarda indekss — to krustpunkta lielums dalīts ar savienojuma lielumu — ir standarta kopas līdzības mērs, ko izmanto informācijas izguvei un gandrīz dublikātu noteikšanai. Augstāks n nozvejo garāku kopīgo frāzi un ir stingrāks attiecībā uz precīzu formulējumu; zemāks n ir piedodošāks un uztver vaļīgu vārdu pārklāšanos pat starp atšķirīgi strukturētiem teikumiem.
Otrais algoritms ir īsts vārdu līmeņa garākā kopējā secība (LCS), kas aprēķināta ar reālu O(n·m) dinamiskās programmēšanas tabulu divās vārdu secībās — tas pats mācību grāmatas algoritms, ko izmanto diferencēšanas rīki, nevis tuvinājums. Atšķirībā no n-gramu rezultāta, LCS neprasa, lai saskaņotie vārdi būtu blakus, tāpēc tas tver pārklāšanos pat tad, ja teikums ir pārkārtots vai nedaudz rediģēts starp koplietotajām frāzēm. Pārklāšanās procentuālā daļa ir iegūta no LCS garuma attiecībā pret abu tekstu vidējo garumu. Pēc tam DP tabula tiek pārvietota atpakaļ, lai precīzi noteiktu, kuri vārdi katrā tekstā piedalījās garākajā kopējā secībā, un šī ir izcilā iezīme: šie vārdi tiek kartēti atpakaļ uz jūsu sākotnējo tekstu — ar oriģinālo atstarpi, rindiņu pārtraukumiem un pieturzīmēm ir neskarti — un tiek renderēti kā izcelti laidumi blakus, lai jūs varētu precīzi redzēt, kuri fragmenti pārklājas, tā vietā, lai uzticētos svītru skaitlim.
Šeit ir nozīme tvērumam un godīgumam: šis ir divu tekstu salīdzināšanas rīks, nevis plaģiāta detektors. Tam nav interneta savienojuma, meklēšanas rādītāja un citu personu satura datu bāzes, ar ko pārbaudīt, — tas var tikai pateikt, cik līdzīgi abi teksti, kuros ielīmējat, ir viens otram. Tas padara to labi piemērotu, lai salīdzinātu pārskatījumu projektus, pārbaudītu, cik daudz pārfrāze vai pārrakstīšana faktiski ir mainījusies, vai gandrīz dublēta satura pamanīšanai savās lapās. Vārdu atbilstības noteikšana nav reģistrjutīga, un O(n·m) LCS tabulas ierobežojums ir daži miljoni vārdu pāru šūnu — ļoti lieliem tekstiem (aptuveni daži tūkstoši vārdu kopā) precīzs LCS un izcelšanas posms tiek izlaists ar piezīmi vienkāršajā valodā, savukārt n-gramu Jaccard rezultāts, kas maksā tikai lineāru laiku, vienmēr tiek aprēķināts pilnā tekstā. Viss darbojas lokāli jūsu pārlūkprogrammā; neviens teksts nekad nepamet jūsu ierīci.