0

Tekstsammenligningsværktøj

Sammenlign to tekster med ægte n-gram Jaccard lighed og en LCS-overlap-score på ordniveau, med de matchende passager fremhævet side om side.

🔒 Behandles helt i din browser - intet, du indtaster her, bliver nogensinde uploadet.

Dette værktøj sammenligner kun de to tekster, du indsætter her — det har ingen internetforbindelse, intet søgeindeks eller indholdsdatabase, så det kan ikke kontrollere for plagiat i forhold til andre websider. Matching er ufølsom over for store/små bogstaver; tegnsætning og linjeskift ignoreres ved scoring, men bevares i den fremhævede visning nedenfor.

Behandler... 0%
Opdeler begge tekster i ord
Beregner n-gram Jaccard lighed
Justerer tekster med en LCS på ordniveau
Gengiver fremhævede matchende ord

Resultat

Dette værktøj sammenligner to tekster, du indsætter, ved hjælp af to uafhængige, ægte, veldokumenterede algoritmer — ikke en vag »ser ens ud«-heuristik. Den første er n-gram Jaccard lighed: hver tekst opdeles i ord og derefter i overlappende sekvenser af n på hinanden følgende ord (et n-gram; standard er n=3, et trigram, og du kan justere det fra 1 til 5). Jaccard-indekset for de to resulterende n-gram-sæt — størrelsen af deres fællesmængde divideret med størrelsen af deres foreningsmængde — er et standard sætbaseret lighedsmål, der anvendes inden for informationssøgning og detektion af næsten-dupletter. Et højere n fanger længere fælles frasering og er strengere med hensyn til eksakt ordlyd; et lavere n er mere tilgivende og fanger løst ordoverlap selv mellem forskelligt strukturerede sætninger.

Den anden algoritme er en ægte længste fælles delsekvens (LCS) på ordniveau, beregnet med en reel O(n·m) dynamisk programmeringstabel over de to ordsekvenser — den samme lærebogsalgoritme, der bruges af diff-værktøjer, ikke en tilnærmelse. I modsætning til n-gram-scoren kræver LCS ikke, at matchede ord er sammenhængende, så den fanger overlap, selv når en sætning er blevet omarrangeret eller let redigeret mellem fælles fraser. Overlapsprocenten udledes af LCS-længden i forhold til den gennemsnitlige længde af begge tekster. DP-tabellen spores derefter tilbage for at identificere præcist hvilke ord i hver tekst, der indgik i den længste fælles sekvens, og dette er den iøjnefaldende funktion: disse ord afbildes tilbage på din originaltekst — med originale mellemrum, linjeskift og tegnsætning intakt — og vises som fremhævede markeringer side om side, så du kan se præcist hvilke passager der overlapper i stedet for at stole på et nøgent tal.

Omfang og ærlighed betyder noget her: dette er et værktøj til sammenligning af to tekster, ikke en plagiatdetektor. Det har ingen internetforbindelse, intet søgeindeks og ingen database med andres indhold at kontrollere imod — det kan kun fortælle dig, hvor ens de to tekster, du indsætter, er indbyrdes. Det gør det velegnet til at sammenligne udkast-revisioner, kontrollere hvor meget en omskrivning eller parafrase faktisk ændrede, eller opdage næsten-duplet indhold på tværs af dine egne sider. Ordmatching er ufølsom over for store/små bogstaver, og O(n·m) LCS-tabellen er begrænset til et par millioner ordpar-celler — for meget store tekster (cirka nogle få tusinde ord tilsammen) springes det eksakte LCS- og fremhævningstrin over med en note i almindeligt sprog, mens n-gram Jaccard-scoren, som kun koster lineær tid, altid beregnes på den fulde tekst. Alt kører lokalt i din browser; ingen af teksterne forlader nogensinde din enhed.