0

Teksta līdzības pārbaudītājs

Salīdziniet divus tekstus ar īstu n-gramu Jaccard līdzību un vārdu līmeņa LCS pārklāšanās punktu skaitu, izceļot atbilstošos fragmentus blakus.

Šis rīks salīdzina tikai divus šeit ielīmētos tekstus — tam nav interneta savienojuma, meklēšanas rādītāja vai satura datu bāzes, tāpēc tas nevar pārbaudīt, vai citās tīmekļa lapās nav plaģiāta. Atbilstība nav reģistrjutīga; Vērtēšanas laikā pieturzīmes un rindiņu pārtraukumi tiek ignorēti, bet tiek saglabāti tālāk izceltajā skatā.

Buy Me a Coffee at ko-fi.com
Notiek apstrāde... 0%
Abu tekstu apzīmēšana vārdos
N-gramu Jaccard līdzības aprēķināšana
Tekstu līdzināšana ar vārdu līmeņa LCS
Atbilstošu vārdu izcēlumu renderēšana

Rezultāts

Šis rīks salīdzina divus tekstus, kurus ielīmējat, izmantojot divus neatkarīgus, reālus, labi dokumentētus algoritmus — nevis neskaidru heiristisku “izskatās līdzīgi”. Pirmā ir n-gramu Jaccard līdzība: katrs teksts tiek pārveidots vārdos, pēc tam sadalīts n secīgu vārdu sērijās, kas pārklājas (n-gram; noklusējuma vērtība ir n=3, trigramma, un jūs varat to pielāgot no 1 līdz 5). Divu iegūto n-gramu kopu Žakarda indekss — to krustpunkta lielums dalīts ar savienojuma lielumu — ir standarta kopas līdzības mērs, ko izmanto informācijas izguvei un gandrīz dublikātu noteikšanai. Augstāks n nozvejo garāku kopīgo frāzi un ir stingrāks attiecībā uz precīzu formulējumu; zemāks n ir piedodošāks un uztver vaļīgu vārdu pārklāšanos pat starp atšķirīgi strukturētiem teikumiem.

Otrais algoritms ir īsts vārdu līmeņa garākā kopējā secība (LCS), kas aprēķināta ar reālu O(n·m) dinamiskās programmēšanas tabulu divās vārdu secībās — tas pats mācību grāmatas algoritms, ko izmanto diferencēšanas rīki, nevis tuvinājums. Atšķirībā no n-gramu rezultāta, LCS neprasa, lai saskaņotie vārdi būtu blakus, tāpēc tas tver pārklāšanos pat tad, ja teikums ir pārkārtots vai nedaudz rediģēts starp koplietotajām frāzēm. Pārklāšanās procentuālā daļa ir iegūta no LCS garuma attiecībā pret abu tekstu vidējo garumu. Pēc tam DP tabula tiek pārvietota atpakaļ, lai precīzi noteiktu, kuri vārdi katrā tekstā piedalījās garākajā kopējā secībā, un šī ir izcilā iezīme: šie vārdi tiek kartēti atpakaļ uz jūsu sākotnējo tekstu — ar oriģinālo atstarpi, rindiņu pārtraukumiem un pieturzīmēm ir neskarti — un tiek renderēti kā izcelti laidumi blakus, lai jūs varētu precīzi redzēt, kuri fragmenti pārklājas, tā vietā, lai uzticētos svītru skaitlim.

Šeit ir nozīme tvērumam un godīgumam: šis ir divu tekstu salīdzināšanas rīks, nevis plaģiāta detektors. Tam nav interneta savienojuma, meklēšanas rādītāja un citu personu satura datu bāzes, ar ko pārbaudīt, — tas var tikai pateikt, cik līdzīgi abi teksti, kuros ielīmējat, ir viens otram. Tas padara to labi piemērotu, lai salīdzinātu pārskatījumu projektus, pārbaudītu, cik daudz pārfrāze vai pārrakstīšana faktiski ir mainījusies, vai gandrīz dublēta satura pamanīšanai savās lapās. Vārdu atbilstības noteikšana nav reģistrjutīga, un O(n·m) LCS tabulas ierobežojums ir daži miljoni vārdu pāru šūnu — ļoti lieliem tekstiem (aptuveni daži tūkstoši vārdu kopā) precīzs LCS un izcelšanas posms tiek izlaists ar piezīmi vienkāršajā valodā, savukārt n-gramu Jaccard rezultāts, kas maksā tikai lineāru laiku, vienmēr tiek aprēķināts pilnā tekstā. Viss darbojas lokāli jūsu pārlūkprogrammā; neviens teksts nekad nepamet jūsu ierīci.