Tekstlikhetssjekker
Sammenlign to tekster med ekte n-gram Jaccard-likhet og en LCS-overlappsscore på ordnivå, med de samsvarende passasjene uthevet side om side.
🔒 Behandles i sin helhet i nettleseren din – ingenting du skriver inn her blir noen gang lastet opp.
Resultat
Dette verktøyet sammenligner to tekster du limer inn ved hjelp av to uavhengige, reelle, veldokumenterte algoritmer — ikke en vag «ser likt ut»-heuristikk. Den første er n-gram Jaccard-likhet: hver tekst tokeniseres til enkeltord, og deles deretter opp i overlappende sekvenser av n påfølgende ord (et n-gram; standardverdien er n=3, et trigram, og du kan justere den fra 1 til 5). Jaccard-indeksen for de to resulterende n-gram-mengdene — størrelsen på snittet delt på størrelsen på unionen — er et standard settbasert likhetsmål som brukes innen informasjonsgjenfinning og deteksjon av nær-duplikater. En høyere n fanger opp lengre felles frasering og er strengere med hensyn til eksakt ordlyd; en lavere n er mer tilgivende og fanger opp løst ordoverlapp selv mellom forskjellig strukturerte setninger.
Den andre algoritmen er en ekte lengste felles delfølge (LCS) på ordnivå, beregnet med en ekte O(n·m) dynamisk programmeringstabell over de to ordsekvensene — den samme lærebokalgoritmen som brukes av diff-verktøy, ikke en tilnærming. I motsetning til n-gram-scoren krever ikke LCS at de matchede ordene er sammenhengende, så den fanger opp overlapp selv når en setning er omorganisert eller lett redigert mellom felles fraser. Overlappsprosenten utledes fra LCS-lengden relativt til gjennomsnittslengden av begge tekster. DP-tabellen spores deretter tilbake for å identifisere nøyaktig hvilke ord i hver tekst som var en del av den lengste felles sekvensen, og dette er den fremtredende funksjonen: disse ordene kartlegges tilbake til originalteksten din — med opprinnelige mellomrom, linjeskift og tegnsetting intakt — og gjengis som uthevede spenn side om side, slik at du kan se nøyaktig hvilke passasjer som overlapper i stedet for å stole på et nakent tall.
Omfang og ærlighet betyr noe her: dette er et verktøy for sammenligning av to tekster, ikke en plagiatdetektor. Det har ingen internettforbindelse, ingen søkeindeks og ingen database med andres innhold å sjekke mot — det kan bare fortelle deg hvor like de to tekstene du limer inn, er i forhold til hverandre. Det gjør det godt egnet til å sammenligne utkast, sjekke hvor mye en parafrase eller omskriving faktisk endret, eller oppdage nær-duplikatinnhold på tvers av dine egne sider. Ordmatching er uavhengig av store og små bokstaver, og O(n·m) LCS-tabellen er begrenset til noen få millioner ordparceller — for svært store tekster (omtrent noen få tusen ord til sammen) hoppes det eksakte LCS- og uthevingstrinnet over med en forklarende merknad, mens n-gram Jaccard-scoren, som bare koster lineær tid, alltid beregnes på hele teksten. Alt kjører lokalt i nettleseren din; ingen av tekstene forlater enheten din.