0

Tekstgelijkeniscontrole

Vergelijk twee teksten met echte n-gram Jaccard-gelijkenis en een LCS-overlapscore op woordniveau, met de overeenkomende passages naast elkaar gemarkeerd.

🔒 Wordt volledig in uw browser verwerkt. Niets wat u hier invoert, wordt ooit geüpload.

Deze tool vergelijkt alleen de twee teksten die u hier plakt — hij heeft geen internetverbinding, zoekindex of inhoudsdatabase, dus kan hij niet op plagiaat controleren ten opzichte van andere webpagina's. De vergelijking is hoofdletterongevoelig; interpunctie en regeleinden worden genegeerd bij de scoring maar blijven behouden in de hieronder gemarkeerde weergave.

Verwerken... 0%
Beide teksten in woorden opsplitsen
N-gram Jaccard-gelijkenis berekenen
Teksten uitlijnen met een LCS op woordniveau
Markering van gematchte woorden weergeven

Resultaat

Deze tool vergelijkt twee teksten die u plakt met twee onafhankelijke, echte, goed gedocumenteerde algoritmes — geen vage 'ziet er hetzelfde uit'-heuristiek. Het eerste is n-gram Jaccard-gelijkenis: elke tekst wordt in woorden opgesplitst en vervolgens verdeeld in overlappende reeksen van n opeenvolgende woorden (een n-gram; de standaard is n=3, een trigram, en u kunt het aanpassen van 1 tot 5). De Jaccard-index van de twee resulterende n-gram-verzamelingen — de grootte van hun doorsnede gedeeld door de grootte van hun vereniging — is een standaard op verzamelingen gebaseerde gelijkenismaat die wordt gebruikt in informatieontsluiting en detectie van bijna-duplicaten. Een hogere n vangt langere gedeelde formuleringen en is strenger qua exacte bewoording; een lagere n is vergevingsgezinder en vangt losse woordoverlap, zelfs tussen verschillend gestructureerde zinnen.

Het tweede algoritme is een echte langste gemeenschappelijke deelreeks (LCS) op woordniveau, berekend met een echte O(n·m)-tabel voor dynamisch programmeren over de twee woordreeksen — hetzelfde schoolvoorbeeldalgoritme dat door diff-tools wordt gebruikt, geen benadering. In tegenstelling tot de n-gram-score vereist de LCS niet dat gematchte woorden aaneengesloten zijn, dus het vangt overlap op, zelfs wanneer een zin opnieuw is gerangschikt of licht is bewerkt tussen gedeelde zinsneden. Het overlappercentage wordt afgeleid uit de LCS-lengte ten opzichte van de gemiddelde lengte van beide teksten. De DP-tabel wordt vervolgens teruggezocht om precies te identificeren welke woorden in elke tekst deelnamen aan die langste gemeenschappelijke reeks, en dit is de opvallende eigenschap: die woorden worden teruggekoppeld naar uw originele tekst — met behoud van de oorspronkelijke spaties, regeleinden en interpunctie — en weergegeven als gemarkeerde fragmenten naast elkaar, zodat u precies kunt zien welke passages overlappen in plaats van te vertrouwen op een kaal getal.

Reikwijdte en eerlijkheid zijn hier belangrijk: dit is een tool voor het vergelijken van twee teksten, geen plagiaatdetector. Hij heeft geen internetverbinding, geen zoekindex en geen database met inhoud van anderen om tegen te controleren — hij kan u alleen vertellen hoe gelijkend de twee teksten die u hier plakt op elkaar zijn. Dat maakt hem zeer geschikt voor het vergelijken van conceptherzieningen, controleren hoeveel een parafrase of herschrijving daadwerkelijk is veranderd, of het opsporen van bijna-duplicaatinhoud op uw eigen pagina's. Woordvergelijking is hoofdletterongevoelig en de O(n·m) LCS-tabel is begrensd op een paar miljoen woordpaarcellen — voor zeer grote teksten (ruwweg een paar duizend woorden gecombineerd) worden de exacte LCS en de markeringsstap overgeslagen met een duidelijke toelichting, terwijl de n-gram Jaccard-score, die slechts lineaire tijd kost, altijd op de volledige tekst wordt berekend. Alles draait lokaal in uw browser; geen van beide teksten verlaat ooit uw apparaat.