0

Preverjevalnik podobnosti besedila

Primerjajte dve besedili z resnično n-gramsko podobnostjo Jaccard in rezultatom prekrivanja LCS na ravni besed, pri čemer sta ujemajoča se odlomka poudarjena drug poleg drugega.

To orodje primerja le dve besedili, ki ju prilepite sem – nima internetne povezave, iskalnega indeksa ali podatkovne baze vsebine, zato ne more preveriti plagiatorstva na drugih spletnih straneh. Ujemanje ne razlikuje med velikimi in malimi črkami; ločila in prelomi vrstic so pri točkovanju prezrti, vendar ohranjeni v označenem pogledu spodaj.

Buy Me a Coffee at ko-fi.com
Obdelava ... 0%
Tokeniziranje obeh besedil v besede
Računanje n-gramske Jaccardove podobnosti
Poravnava besedil z LCS na ravni besed
Upodabljanje poudarkov ujemajočih se besed

Rezultat

To orodje primerja dve besedili, ki ju prilepite, z uporabo dveh neodvisnih, resničnih, dobro dokumentiranih algoritmov – ne z nejasno hevristiko »izgleda podobno«. Prva je n-gramska podobnost Jaccard: vsako besedilo je tokenizirano v besede, nato razdeljeno na prekrivajoče nize n zaporednih besed (n-gram; privzeto je n=3, trigram, in ga lahko prilagodite od 1 do 5). Jaccardov indeks dveh nastalih nizov n-gramov – velikost njunega presečišča, deljena z velikostjo njune unije – je standardna mera podobnosti, ki temelji na množici in se uporablja pri iskanju informacij in zaznavanju skoraj podvojenih podatkov. Višji n ujame daljše skupno fraziranje in je strožji glede točnega besedila; nižji n je bolj prizanesljiv in ujame ohlapno prekrivanje besed tudi med različno strukturiranimi stavki.

Drugi algoritem je pristno najdaljše skupno podzaporedje (LCS) na ravni besede, izračunano z realno tabelo dinamičnega programiranja O(n·m) nad dvema besednima zaporedjema – isti učbeniški algoritem, ki ga uporabljajo orodja za razlikovanje, ne približek. V nasprotju z rezultatom n-gramov LCS ne zahteva, da so ujemajoče se besede sosednje, zato zajame prekrivanje, tudi če je bil stavek prerazporejen ali rahlo urejen med frazami v skupni rabi. Odstotek prekrivanja je izpeljan iz dolžine LCS glede na povprečno dolžino obeh besedil. Tabela DP se nato vrne nazaj, da se natančno ugotovi, katere besede v posameznem besedilu so sodelovale v tem najdaljšem skupnem zaporedju, in to je značilnost, ki izstopa: te besede so preslikane nazaj na vaše izvirno besedilo – z nedotaknjenimi prvotnimi presledki, prelomi vrstic in ločili – in upodobljene kot označeni razponi drug ob drugem, tako da lahko natančno vidite, kateri odlomki se prekrivajo, namesto da zaupate goli številki.

Tukaj sta pomembna obseg in poštenost: to je orodje za primerjavo dveh besedil in ne detektor plagiatorstva. Nima internetne povezave, iskalnega indeksa in baze podatkov o vsebini drugih ljudi, s katero bi lahko preveril — pove vam lahko le, kako podobni sta si obe besedili, ki ju prilepite. Zaradi tega je zelo primeren za primerjavo revizij osnutkov, preverjanje, koliko se je parafraza ali prepis dejansko spremenilo, ali odkrivanje skoraj podvojene vsebine na vaših straneh. Ujemanje besed ne razlikuje med velikimi in velikimi črkami, tabela O(n·m) LCS pa je omejena na nekaj milijonov celic besednih parov – za zelo velika besedila (približno nekaj tisoč besed skupaj) sta natančen korak LCS in označevanja preskočena z opombo v preprostem jeziku, medtem ko se rezultat n-gram Jaccard, ki stane le linearni čas, vedno izračuna na celotnem besedilu. Vse deluje lokalno v vašem brskalniku; nobeno besedilo nikoli ne zapusti vaše naprave.