Preverjevalnik podobnosti besedil
Primerjajte dve besedili s pravo podobnostjo n-gramov Jaccard in oceno prekrivanja LCS na ravni besed, z ujemajočimi se odlomki, označenimi drug ob drugem.
🔒 V celoti obdelano v vašem brskalniku – nič, kar tukaj vnesete, ni nikoli naloženo.
Rezultat
To orodje primerja dve besedili, ki ju prilepite, z uporabo dveh neodvisnih, resničnih, dobro dokumentiranih algoritmov – ne z nejasno hevristiko »videti je podobno«. Prvi je podobnost n-gramov Jaccard: vsako besedilo se razčleni v besede, nato pa razdeli v prekrivajoče se nize n zaporednih besed (n-gram; privzeto je n=3, trigram, nastavite pa ga lahko od 1 do 5). Indeks Jaccard obeh nastalih množic n-gramov – velikost njunega preseka, deljena z velikostjo njune unije – je standardno merilo podobnosti na podlagi množic, ki se uporablja pri iskanju informacij in odkrivanju skoraj podvojenih vsebin. Višji n zazna daljše skupne fraze in je strožji glede natančnega besedišča; nižji n je bolj prizanesljiv in zazna ohlapno prekrivanje besed tudi med različno strukturiranimi stavki.
Drugi algoritem je pristno najdaljše skupno podzaporedje (LCS) na ravni besed, izračunano z resnično dinamično-programsko tabelo O(n·m) nad obema zaporedjema besed – isti učbeniški algoritem, ki ga uporabljajo orodja diff, ne približek. V nasprotju z oceno n-gramov LCS ne zahteva, da so ujemajoče se besede zaporedne, zato zajame prekrivanje tudi, kadar je bil stavek preurejen ali rahlo urejen med skupnimi frazami. Odstotek prekrivanja je izpeljan iz dolžine LCS glede na povprečno dolžino obeh besedil. Nato se po tabeli DP vračamo po sledi, da natančno določimo, katere besede v vsakem besedilu so bile del tega najdaljšega skupnega zaporedja, in to je izstopajoča lastnost: te besede se preslikajo nazaj na vaše izvirno besedilo – z nedotaknjenimi prvotnimi razmiki, prelomi vrstic in ločili – ter upodobijo kot označeni razponi drug ob drugem, tako da lahko natančno vidite, kateri odlomki se prekrivajo, namesto da bi zaupali goli številki.
Tu sta pomembna obseg in poštenost: to je orodje za primerjavo dveh besedil, ne detektor plagiatorstva. Nima internetne povezave, iskalnega indeksa in zbirke podatkov z vsebino drugih, s katero bi preverjalo – vedno lahko pove le, kako podobni sta si dve besedili, ki ju prilepite. Zaradi tega je zelo primerno za primerjavo osnutkov popravkov, preverjanje, koliko sta se parafraza ali prepis dejansko spremenila, ali odkrivanje skoraj podvojene vsebine na lastnih straneh. Ujemanje besed ne razlikuje velikih in malih črk, tabela LCS O(n·m) pa je omejena na nekaj milijonov celic besednih parov – pri zelo velikih besedilih (približno nekaj tisoč besed skupaj) se korak natančnega LCS in označevanja preskoči s preprostim pojasnilom, medtem ko se ocena n-gramov Jaccard, ki zahteva le linearni čas, vedno izračuna na celotnem besedilu. Vse poteka lokalno v vašem brskalniku; nobeno besedilo nikoli ne zapusti vaše naprave.