Teksta līdzības pārbaudītājs
Salīdziniet divus tekstus ar īstu n-gramu Jaccard līdzību un vārdu līmeņa LCS pārklāšanās vērtējumu, sakrītošos fragmentus izceļot blakus.
🔒 Pilnībā apstrādāts jūsu pārlūkprogrammā — nekas, ko jūs šeit ievadāt, nekad netiek augšupielādēts.
Rezultāts
Šis rīks salīdzina divus jūsu ievietotos tekstus, izmantojot divus neatkarīgus, īstus, labi dokumentētus algoritmus — nevis miglainu "izskatās līdzīgi" heiristiku. Pirmais ir n-gramu Jaccard līdzība: katrs teksts tiek sadalīts vārdos, pēc tam sadalīts pārklājošās n secīgu vārdu grupās (n-gramā; noklusējums ir n=3, trigrams, un jūs varat to pielāgot no 1 līdz 5). Abu iegūto n-gramu kopu Jaccard indekss — to šķēluma lielums dalīts ar to apvienojuma lielumu — ir standarta kopās balstīts līdzības mērs, ko izmanto informācijas meklēšanā un gandrīz identisku dublikātu noteikšanā. Augstāks n uztver garākas kopīgas frāzes un ir stingrāks attiecībā uz precīzu formulējumu; zemāks n ir pielaidīgāks un uztver brīvu vārdu pārklāšanos pat starp atšķirīgi strukturētiem teikumiem.
Otrais algoritms ir īsta vārdu līmeņa garākā kopīgā apakšvirkne (LCS), kas aprēķināta ar īstu O(n·m) dinamiskās programmēšanas tabulu pār abām vārdu virknēm — tas pats mācību grāmatu algoritms, ko izmanto diff rīki, nevis tuvinājums. Atšķirībā no n-gramu vērtējuma, LCS neprasa, lai sakritušie vārdi būtu blakus, tāpēc tā uztver pārklāšanos pat tad, ja teikums ir pārkārtots vai viegli rediģēts starp kopīgām frāzēm. Pārklāšanās procentuālo daļu iegūst no LCS garuma attiecībā pret abu tekstu vidējo garumu. Pēc tam DP tabula tiek atpakaļizsekota, lai identificētu tieši tos vārdus katrā tekstā, kas piedalījās šajā garākajā kopīgajā virknē, un šī ir izcilā funkcija: šie vārdi tiek attiecināti atpakaļ uz jūsu oriģinālo tekstu — ar tā oriģinālajām atstarpēm, rindiņu pārtraukumiem un pieturzīmēm neskartām — un attēloti kā izcelti fragmenti blakus, lai jūs varētu redzēt, kuri fragmenti tieši pārklājas, nevis paļauties uz kailu skaitli.
Šeit svarīgs ir tvērums un godīgums: šis ir divu tekstu salīdzināšanas rīks, nevis plaģiātisma detektors. Tam nav interneta savienojuma, meklēšanas indeksa un datubāzes ar citu cilvēku saturu, ar ko salīdzināt — tas var pateikt tikai to, cik līdzīgi viens otram ir divi jūsu ievietotie teksti. Tas padara to labi piemērotu melnrakstu versiju salīdzināšanai, pārbaudei, cik daudz pārfrāzējums vai pārrakstīšana patiesībā mainīja, vai gandrīz identiska satura pamanīšanai savās lapās. Vārdu salīdzināšana nav reģistrjutīga, un O(n·m) LCS tabula ir ierobežota līdz dažiem miljoniem vārdu pāru šūnu — ļoti lieliem tekstiem (aptuveni daži tūkstoši vārdu kopā) precīzais LCS un izcelšanas solis tiek izlaists ar vienkāršu piezīmi, kamēr n-gramu Jaccard vērtējums, kas prasa tikai lineāru laiku, vienmēr tiek aprēķināts pilnam tekstam. Viss darbojas lokāli jūsu pārlūkā; neviens teksts nekad nepamet jūsu ierīci.