0

Teksto panašumo tikrintuvas

Palyginkite du tekstus su realiu n-gramų Jaccard panašumu ir žodžių lygmens LCS sutapimo balu, o atitinkamas ištraukas paryškinkite greta.

Šis įrankis lygina tik du tekstus, kuriuos čia įklijuojate – jis neturi interneto ryšio, paieškos indekso ar turinio duomenų bazės, todėl negali patikrinti, ar kituose tinklalapiuose nėra plagijavimo. Atitikimas neskiria didžiųjų ir mažųjų raidžių; skyrybos ženklai ir eilučių lūžiai įvertinant balus nepaisomi, bet išsaugomi toliau esančiame paryškintame rodinyje.

Buy Me a Coffee at ko-fi.com
Apdorojama... 0%
Abiejų tekstų pavertimas žodžiais
N-gramų Jaccard panašumo skaičiavimas
Tekstų lygiavimas su žodžio lygio LCS
Atitinkamų žodžių paryškinimų atvaizdavimas

Rezultatas

Šis įrankis lygina du tekstus, kuriuos įklijuojate naudodami du nepriklausomus, tikrus, gerai dokumentuotus algoritmus – neaiškios euristikos „atrodo panašiai“. Pirmasis yra n gramų Jaccard panašumas: kiekvienas tekstas paverčiamas žodžiais, tada suskaidomas į persidengiančias n iš eilės žodžių eilutes (n gramas; numatytoji vertė yra n = 3, trigrama ir galite ją koreguoti nuo 1 iki 5). Dviejų gautų n-gramų rinkinių Jaccard indeksas – jų susikirtimo dydis padalytas iš jų sąjungos dydžio – yra standartinis rinkiniu pagrįstas panašumo matas, naudojamas informacijos gavimui ir beveik pasikartojančių duomenų aptikimui. Didesnis n užfiksuoja ilgesnę bendrinamą frazę ir griežtesnis tikslios formuluotės atžvilgiu; žemesnis n yra atlaidesnis ir pagauna laisvą žodžių sutapimą net tarp skirtingos struktūros sakinių.

Antrasis algoritmas yra tikras žodžių lygio Longest Common Subsequence (LCS), apskaičiuojamas naudojant tikrą O(n·m) dinaminio programavimo lentelę per dvi žodžių sekas – tą patį vadovėlio algoritmą, kurį naudoja diferencijavimo įrankiai, o ne apytikslis. Skirtingai nuo n-gramų balo, LCS nereikalauja, kad suderinti žodžiai būtų gretimi, todėl užfiksuoja sutapimą net tada, kai sakinys buvo pertvarkytas arba šiek tiek redaguojamas tarp bendrinamų frazių. Persidengimo procentas gaunamas iš LCS ilgio, palyginti su vidutiniu abiejų tekstų ilgiu. Tada DP lentelė atsukama, kad būtų tiksliai identifikuoti, kurie kiekvieno teksto žodžiai dalyvavo toje ilgiausioje bendroje sekoje, ir tai yra išskirtinė savybė: šie žodžiai grąžinami į pradinį tekstą – nepažeidžiant pradinių tarpų, eilučių lūžių ir skyrybos ženklų – ir pateikiami kaip paryškinti tarpai vienas šalia kito, todėl galite tiksliai matyti, kurios ištraukos sutampa, o ne pasitikėti skaičiumi.

Čia svarbu apimtis ir sąžiningumas: tai dviejų tekstų palyginimo įrankis, o ne plagiato detektorius. Jame nėra interneto ryšio, paieškos indekso ir kitų žmonių turinio duomenų bazės, kurią būtų galima patikrinti – ji gali tik pasakyti, kiek panašūs vienas į kitą yra du tekstai, į kuriuos įklijuojate. Dėl to jis puikiai tinka lyginant juodraščius, patikrinti, kiek iš tikrųjų pasikeitė perfrazė ar perrašymas, arba aptikti beveik pasikartojantį turinį savo puslapiuose. Žodžių atitikimas neskiriamas didžiosioms ir mažosioms raidėms, o O(n·m) LCS lentelė apribota iki kelių milijonų žodžių porų langelių – labai dideliems tekstams (maždaug keli tūkstančiai žodžių kartu) tikslus LCS ir paryškinimo veiksmas praleidžiamas su užrašu paprasta kalba, o n gramų Jaccard balas, kuris kainuoja tik linijinį laiką, visada skaičiuojamas visame tekste. Viskas veikia lokaliai jūsų naršyklėje; nė vienas tekstas nepalieka jūsų įrenginio.