0

Tekstlikhetskontroll

Sammenlign to tekster med ekte n-gram Jaccard-likhet og en LCS-overlapping på ordnivå, med samsvarende passasjer uthevet side ved side.

Dette verktøyet sammenligner bare de to tekstene du limer inn her – det har ingen internettforbindelse, søkeindeks eller innholdsdatabase, så det kan ikke se etter plagiat mot andre nettsider. Matching skiller mellom store og små bokstaver; tegnsetting og linjeskift ignoreres ved scoring, men beholdes i den uthevede visningen nedenfor.

Buy Me a Coffee at ko-fi.com
Behandler... 0%
Tokeniserer begge tekstene til ord
Databehandling n-gram Jaccard likhet
Justere tekster med en LCS på ordnivå
Gjengivelse av høydepunkter med samsvarende ord

Resultat

Dette verktøyet sammenligner to tekster du limer inn ved å bruke to uavhengige, ekte, godt dokumenterte algoritmer - ikke en vag heuristikk som ligner på "likner". Den første er n-gram Jaccard-likhet: hver tekst er tokenisert til ord, deretter delt inn i overlappende serier av n påfølgende ord (en n-gram; standard er n=3, et trigram, og du kan justere det fra 1 til 5). Jaccard-indeksen for de to resulterende n-gram-settene - størrelsen på skjæringspunktet deres delt på størrelsen på deres forening - er et standard settbasert likhetsmål som brukes på tvers av informasjonsinnhenting og nesten duplikatdeteksjon. En høyere n fanger lengre delt frasering og er strengere med nøyaktig ordlyd; en lavere n er mer tilgivende og fanger løs ordoverlapping selv mellom ulikt strukturerte setninger.

Den andre algoritmen er en ekte ord-nivå Longest Common Subsequence (LCS), beregnet med en ekte O(n·m) dynamisk programmeringstabell over de to ordsekvensene - den samme lærebokalgoritmen som brukes av diff-verktøy, ikke en tilnærming. I motsetning til n-gram-poengsummen, krever ikke LCS at samsvarende ord er sammenhengende, så det fanger opp overlapping selv når en setning har blitt omorganisert eller lett redigert mellom delte fraser. Overlappsprosenten er utledet fra LCS-lengden i forhold til gjennomsnittslengden på begge tekstene. DP-tabellen blir deretter sporet tilbake for å identifisere nøyaktig hvilke ord i hver tekst som deltok i den lengste vanlige sekvensen, og dette er den fremtredende funksjonen: disse ordene blir kartlagt tilbake til den opprinnelige teksten din – med dens opprinnelige avstand, linjeskift og tegnsetting intakt – og gjengitt som uthevede spenn side ved side, slik at du kan se nøyaktig hvilke passasjer som overlapper hverandre i stedet for overlapping.

Omfang og ærlighet betyr noe her: dette er et sammenligningsverktøy med to tekster, ikke en plagiatdetektor. Den har ingen internettforbindelse, ingen søkeindeks og ingen database med andres innhold å sjekke mot - den kan bare fortelle deg hvor like de to tekstene du limer inn er til hverandre. Det gjør den godt egnet til å sammenligne utkast til revisjoner, sjekke hvor mye en omskrivning eller omskriving faktisk endret seg, eller å se nesten duplikatinnhold på tvers av dine egne sider. Ordtilpasning skiller ikke mellom store og små bokstaver, og O(n·m) LCS-tabellen er begrenset til noen få millioner ordparceller - for svært store tekster (omtrent noen få tusen ord kombinert) hoppes det nøyaktige LCS- og uthevingstrinnet over med et vanlig språknotat, mens n-gram Jaccard-poengsummen, som bare koster lineær tid, alltid beregnes på fullteksten. Alt kjører lokalt i nettleseren din; ingen av tekstene forlater enheten din.