0

Tekstlighedskontrol

Sammenlign to tekster med ægte n-gram Jaccard-lighed og en LCS-overlapningsscore på ordniveau, med de matchende passager fremhævet side om side.

Dette værktøj sammenligner kun de to tekster, du indsætter her - det har ingen internetforbindelse, søgeindeks eller indholdsdatabase, så det kan ikke kontrollere for plagiat mod andre websider. Matching er ufølsom over for store og små bogstaver; tegnsætning og linjeskift ignoreres ved scoring, men bevares i den fremhævede visning nedenfor.

Buy Me a Coffee at ko-fi.com
Behandler... 0%
Tokeniserer begge tekster til ord
Computing n-gram Jaccard lighed
Justering af tekster med en LCS på ordniveau
Gengivelse af fremhævede ord med matchede ord

Resultat

Dette værktøj sammenligner to tekster, du indsætter i, ved hjælp af to uafhængige, rigtige, veldokumenterede algoritmer – ikke en vag "ligner lignende" heuristik. Den første er n-gram Jaccard-lighed: hver tekst er tokeniseret til ord, derefter opdelt i overlappende rækker af n på hinanden følgende ord (et n-gram; standard er n=3, et trigram, og du kan justere det fra 1 til 5). Jaccard-indekset for de to resulterende n-gram sæt - størrelsen af ​​deres skæringspunkt divideret med størrelsen af ​​deres forening - er et standard sæt-baseret lighedsmål, der bruges på tværs af informationssøgning og næsten duplikatdetektion. Et højere n fanger længere delt frasering og er strengere med hensyn til nøjagtige formuleringer; et lavere n er mere tilgivende og fanger løst ordoverlap selv mellem forskelligt strukturerede sætninger.

Den anden algoritme er en ægte ord-niveau Longest Common Subsequence (LCS), beregnet med en ægte O(n·m) dynamisk programmeringstabel over de to ordsekvenser - den samme lærebogsalgoritme, der bruges af diff-værktøjer, ikke en tilnærmelse. I modsætning til n-gram scoren kræver LCS ikke, at matchede ord er sammenhængende, så det fanger overlap, selv når en sætning er blevet omorganiseret eller let redigeret mellem delte sætninger. Overlapningsprocenten er afledt af LCS-længden i forhold til gennemsnitslængden af ​​begge tekster. DP-tabellen bliver derefter trukket tilbage for at identificere præcist, hvilke ord i hver tekst, der deltog i den længste fælles sekvens, og dette er det iøjnefaldende træk: disse ord er kortlagt tilbage til din originale tekst - med dens oprindelige mellemrum, linjeskift og tegnsætning intakt - og gengivet som fremhævede spænder side om side, så du kan se nøjagtigt, hvilke passager, der overlapper i stedet for overlappende.

Omfang og ærlighed betyder noget her: dette er et to-tekst sammenligningsværktøj, ikke en plagiatdetektor. Den har ingen internetforbindelse, intet søgeindeks og ingen database med andres indhold at tjekke mod - det kan kun fortælle dig, hvor ens de to tekster, du indsætter i, er hinanden. Det gør den velegnet til at sammenligne udkast til revisioner, tjekke, hvor meget en omskrivning eller omskrivning faktisk har ændret sig, eller at se næsten duplikeret indhold på tværs af dine egne sider. Ordmatching er ufølsom over for store og små bogstaver, og O(n·m) LCS-tabellen er begrænset til et par millioner ordparceller - for meget store tekster (omtrent et par tusinde ord kombineret) springes det nøjagtige LCS og fremhævningstrin over med en note i almindeligt sprog, mens n-gram Jaccard-score, som kun koster lineær tid, altid beregnes på den fulde tekst. Alt kører lokalt i din browser; ingen af ​​teksterne forlader din enhed.