0

Verificator de similaritate text

Comparați două texte cu similitudini reale cu n-grame Jaccard și un scor de suprapunere LCS la nivel de cuvânt, cu pasajele care se potrivesc evidențiate una lângă alta.

Acest instrument compară doar cele două texte pe care le lipiți aici - nu are conexiune la internet, index de căutare sau bază de date de conținut, așa că nu poate verifica dacă există plagiat față de alte pagini web. Potrivirea este insensibilă la majuscule; semnele de punctuație și întreruperile de rând sunt ignorate la punctare, dar păstrate în vizualizarea evidențiată de mai jos.

Buy Me a Coffee at ko-fi.com
Procesare... 0%
Tokenizarea ambelor texte în cuvinte
Calcularea asemănării cu n-grame Jaccard
Alinierea textelor cu un LCS la nivel de cuvânt
Evidențierea cuvintelor potrivite

Rezultat

Acest instrument compară două texte în care lipiți folosind doi algoritmi independenți, reali și bine documentați - nu o euristică vagă „are similară”. Primul este asemănarea cu n-grame Jaccard: fiecare text este tokenizat în cuvinte, apoi împărțit în secțiuni suprapuse de n cuvinte consecutive (un n-gram; implicit este n=3, o trigramă și îl puteți ajusta de la 1 la 5). Indicele Jaccard al celor două seturi de n-grame rezultate - mărimea intersecției lor împărțită la dimensiunea uniunii lor - este o măsură standard de similitudine bazată pe seturi, utilizată în regăsirea informațiilor și detectarea aproape duplicatelor. Un n mai mare prinde fraze partajate mai lungi și este mai strict în ceea ce privește formularea exactă; un n mai mic este mai îngăduitor și prinde o suprapunere liberă a cuvintelor chiar și între propoziții structurate diferit.

Al doilea algoritm este o subsecvență comună cea mai lungă (LCS) la nivel de cuvânt, calculată cu un tabel de programare dinamică reală O(n·m) peste cele două secvențe de cuvinte - același algoritm de manual folosit de instrumentele de dif, nu o aproximare. Spre deosebire de scorul n-grame, LCS nu necesită ca cuvintele potrivite să fie învecinate, astfel încât surprinde suprapunerea chiar și atunci când o propoziție a fost reordonată sau editată ușor între fraze partajate. Procentul de suprapunere este derivat din lungimea LCS în raport cu lungimea medie a ambelor texte. Tabelul DP este apoi inversat pentru a identifica cu precizie cuvintele din fiecare text care au luat parte la cea mai lungă secvență comună, iar aceasta este caracteristica remarcabilă: acele cuvinte sunt mapate înapoi pe textul original - cu spațierea inițială, întreruperile de rând și semnele de punctuație intacte - și redate sub formă de întinderi evidențiate una lângă alta, astfel încât să puteți vedea exact ce pasaje se suprapun în loc de număr de bare.

Domeniul de aplicare și onestitatea contează aici: acesta este un instrument de comparare cu două texte, nu un detector de plagiat. Nu are nicio conexiune la internet, nici un index de căutare și nicio bază de date cu conținutul altor persoane cu care să verificați - vă poate spune doar cât de asemănătoare sunt cele două texte în care lipiți unul cu celălalt. Acest lucru îl face foarte potrivit pentru a compara versiunile nefinalizate, pentru a verifica cât de mult s-a schimbat efectiv o parafrază sau o rescrie sau pentru a identifica conținut aproape duplicat în propriile pagini. Potrivirea cuvintelor nu ține seama de majuscule și minuscule, iar tabelul O(n·m) LCS este limitat la câteva milioane de celule perechi de cuvinte - pentru texte foarte mari (aproximativ câteva mii de cuvinte combinate) pasul exact de LCS și evidențiere este omis cu o notă în limbaj simplu, în timp ce scorul de n-grame Jaccard, care costă doar timp liniar, este întotdeauna calculat pe textul complet. Totul rulează local în browserul dvs.; niciun text nu părăsește dispozitivul.