Tekstlikhetskontroll
Sammenlign to tekster med ekte n-gram Jaccard-likhet og en LCS-overlapping på ordnivå, med samsvarende passasjer uthevet side ved side.
Resultat
Dette verktøyet sammenligner to tekster du limer inn ved å bruke to uavhengige, ekte, godt dokumenterte algoritmer - ikke en vag heuristikk som ligner på "likner". Den første er n-gram Jaccard-likhet: hver tekst er tokenisert til ord, deretter delt inn i overlappende serier av n påfølgende ord (en n-gram; standard er n=3, et trigram, og du kan justere det fra 1 til 5). Jaccard-indeksen for de to resulterende n-gram-settene - størrelsen på skjæringspunktet deres delt på størrelsen på deres forening - er et standard settbasert likhetsmål som brukes på tvers av informasjonsinnhenting og nesten duplikatdeteksjon. En høyere n fanger lengre delt frasering og er strengere med nøyaktig ordlyd; en lavere n er mer tilgivende og fanger løs ordoverlapping selv mellom ulikt strukturerte setninger.
Den andre algoritmen er en ekte ord-nivå Longest Common Subsequence (LCS), beregnet med en ekte O(n·m) dynamisk programmeringstabell over de to ordsekvensene - den samme lærebokalgoritmen som brukes av diff-verktøy, ikke en tilnærming. I motsetning til n-gram-poengsummen, krever ikke LCS at samsvarende ord er sammenhengende, så det fanger opp overlapping selv når en setning har blitt omorganisert eller lett redigert mellom delte fraser. Overlappsprosenten er utledet fra LCS-lengden i forhold til gjennomsnittslengden på begge tekstene. DP-tabellen blir deretter sporet tilbake for å identifisere nøyaktig hvilke ord i hver tekst som deltok i den lengste vanlige sekvensen, og dette er den fremtredende funksjonen: disse ordene blir kartlagt tilbake til den opprinnelige teksten din – med dens opprinnelige avstand, linjeskift og tegnsetting intakt – og gjengitt som uthevede spenn side ved side, slik at du kan se nøyaktig hvilke passasjer som overlapper hverandre i stedet for overlapping.
Omfang og ærlighet betyr noe her: dette er et sammenligningsverktøy med to tekster, ikke en plagiatdetektor. Den har ingen internettforbindelse, ingen søkeindeks og ingen database med andres innhold å sjekke mot - den kan bare fortelle deg hvor like de to tekstene du limer inn er til hverandre. Det gjør den godt egnet til å sammenligne utkast til revisjoner, sjekke hvor mye en omskrivning eller omskriving faktisk endret seg, eller å se nesten duplikatinnhold på tvers av dine egne sider. Ordtilpasning skiller ikke mellom store og små bokstaver, og O(n·m) LCS-tabellen er begrenset til noen få millioner ordparceller - for svært store tekster (omtrent noen få tusen ord kombinert) hoppes det nøyaktige LCS- og uthevingstrinnet over med et vanlig språknotat, mens n-gram Jaccard-poengsummen, som bare koster lineær tid, alltid beregnes på fullteksten. Alt kjører lokalt i nettleseren din; ingen av tekstene forlater enheten din.