0

Tekstgelijkeniscontrole

Vergelijk twee teksten met echte n-gram Jaccard-overeenkomst en een LCS-overlapscore op woordniveau, waarbij de overeenkomende passages naast elkaar zijn gemarkeerd.

Deze tool vergelijkt alleen de twee teksten die u hier plakt. Het heeft geen internetverbinding, zoekindex of inhoudsdatabase, dus het kan niet controleren op plagiaat ten opzichte van andere webpagina's. Matchen is hoofdlettergevoelig; interpunctie en regeleinden worden genegeerd bij het scoren, maar blijven behouden in de gemarkeerde weergave hieronder.

Buy Me a Coffee at ko-fi.com
Verwerken... 0%
Het tokeniseren van beide teksten in woorden
N-gram Jaccard-gelijkenis berekenen
Teksten uitlijnen met een LCS op woordniveau
Hoogtepunten van overeenkomende woorden weergeven

Resultaat

Deze tool vergelijkt twee teksten die je plakt met behulp van twee onafhankelijke, echte, goed gedocumenteerde algoritmen - en niet een vage heuristiek van "lijkt op elkaar". De eerste is de n-gram Jaccard-overeenkomst: elke tekst wordt in woorden omgezet en vervolgens opgesplitst in overlappende reeksen van n opeenvolgende woorden (een n-gram; de standaardwaarde is n=3, een trigram, en je kunt dit aanpassen van 1 tot 5). De Jaccard-index van de twee resulterende n-gramsets – de grootte van hun snijpunt gedeeld door de grootte van hun vereniging – is een standaard set-gebaseerde overeenkomstmaatstaf die wordt gebruikt bij het ophalen van informatie en de detectie van bijna-duplicaten. Een hogere n vangt langere gedeelde frasering op en is strenger over de exacte bewoording; een lagere n is vergevingsgezinder en vangt losse woordoverlap op, zelfs tussen verschillend gestructureerde zinnen.

Het tweede algoritme is een echte Longest Common Subsequence (LCS) op woordniveau, berekend met een echte O(n·m) dynamische programmeertabel over de twee woordreeksen - hetzelfde leerboekalgoritme dat wordt gebruikt door diff-tools, geen benadering. In tegenstelling tot de n-gram-score vereist de LCS niet dat overeenkomende woorden aaneengesloten zijn, dus wordt overlap vastgelegd, zelfs wanneer een zin opnieuw is geordend of lichtjes is bewerkt tussen gedeelde zinsdelen. Het overlappercentage wordt afgeleid van de LCS-lengte ten opzichte van de gemiddelde lengte van beide teksten. De DP-tabel wordt vervolgens teruggetrokken om precies te identificeren welke woorden in elke tekst deel uitmaakten van de langste gemeenschappelijke reeks, en dit is het opvallende kenmerk: die woorden worden teruggeplaatst in uw originele tekst (met de oorspronkelijke spatiëring, regeleinden en interpunctie intact) en weergegeven als gemarkeerde reeksen naast elkaar, zodat u precies kunt zien welke passages elkaar overlappen in plaats van te vertrouwen op een kaal getal.

Reikwijdte en eerlijkheid zijn hier van belang: dit is een vergelijkingstool met twee teksten, geen plagiaatdetector. Het heeft geen internetverbinding, geen zoekindex en geen database met de inhoud van anderen om te vergelijken. Het kan je alleen maar vertellen hoe vergelijkbaar de twee teksten die je plakt met elkaar zijn. Dat maakt het zeer geschikt om conceptrevisies te vergelijken, te controleren hoeveel een parafrase of herschrijving daadwerkelijk is veranderd, of om bijna dubbele inhoud op uw eigen pagina's te spotten. Het matchen van woorden is niet hoofdlettergevoelig, en de O(n·m) LCS-tabel is beperkt tot een paar miljoen woordenpaarcellen. Voor zeer grote teksten (ruwweg een paar duizend woorden gecombineerd) wordt de exacte LCS- en accentueringsstap overgeslagen met een opmerking in gewone taal, terwijl de n-gram Jaccard-score, die alleen lineaire tijd kost, altijd wordt berekend op basis van de volledige tekst. Alles draait lokaal in je browser; geen enkele tekst verlaat ooit uw apparaat.