Textlikhetskontroll
Jämför två texter med riktig n-grams Jaccard-likhet och ett LCS-överlappsmått på ordnivå, där matchande passager markeras sida vid sida.
🔒 Bearbetas helt i din webbläsare – ingenting du anger här laddas någonsin upp.
Resultat
Detta verktyg jämför två texter du klistrar in med hjälp av två oberoende, riktiga, väldokumenterade algoritmer — inte en vag 'ser lika ut'-heuristik. Den första är n-grams Jaccard-likhet: varje text tokeniseras till ord och delas sedan upp i överlappande serier av n på varandra följande ord (ett n-gram; standardvärdet är n=3, ett trigram, och du kan justera det från 1 till 5). Jaccard-indexet för de två resulterande n-grammängderna — storleken på deras snitt dividerat med storleken på deras union — är ett standardmått på mängdbaserad likhet som används inom informationssökning och detektering av nära dubbletter. Ett högre n fångar längre delad formulering och är striktare vad gäller exakt ordalydelse; ett lägre n är mer förlåtande och fångar lös ordöverlappning även mellan olika strukturerade meningar.
Den andra algoritmen är en genuin längsta gemensam ordsekvens (LCS), beräknad med en äkta O(n·m) dynamisk programmeringstabell över de två ordföljderna — samma läroboksalgoritm som används av diff-verktyg, inte en approximation. Till skillnad från n-grampoängen kräver LCS inte att matchade ord är sammanhängande, så den fångar överlapp även när en mening har kastats om eller redigerats lätt mellan delade fraser. Överlappsprocenten härleds från LCS-längden i förhållande till den genomsnittliga längden på båda texterna. DP-tabellen återspåras sedan för att identifiera exakt vilka ord i varje text som ingick i den längsta gemensamma sekvensen, och detta är den framstående funktionen: dessa ord mappas tillbaka till din originaltext — med dess ursprungliga mellanslag, radbrytningar och interpunktion intakt — och renderas som markerade spann sida vid sida, så att du kan se exakt vilka passager som överlappar istället för att lita på en naken siffra.
Räckvidd och ärlighet spelar roll här: detta är ett verktyg för att jämföra två texter, inte en plagiatdetektor. Det har ingen internetanslutning, inget sökindex och ingen databas med andras innehåll att kontrollera mot — det kan bara tala om hur lika de två texterna du klistrar in är varandra. Det gör det väl lämpat för att jämföra utkastversioner, kontrollera hur mycket en omskrivning eller omarbetning faktiskt ändrade, eller upptäcka nära dubblettinnehåll på dina egna sidor. Ordmatchning är skiftlägesokänslig, och O(n·m) LCS-tabellen är begränsad till några miljoner ordparceller — för mycket stora texter (ungefär några tusen ord totalt) hoppas det exakta LCS- och markeringssteget över med en tydlig notering, medan n-grams Jaccard-poängen, som bara kostar linjär tid, alltid beräknas på hela texten. Allt körs lokalt i din webbläsare; ingen av texterna lämnar någonsin din enhet.