0

Textlikhetskontroll

Jämför två texter med verklig n-gram Jaccard-likhet och en LCS-överlappning på ordnivå, med matchande passager markerade sida vid sida.

Det här verktyget jämför bara de två texterna du klistrar in här - det har ingen internetanslutning, sökindex eller innehållsdatabas, så det kan inte kontrollera plagiat mot andra webbsidor. Matchning är skiftlägesokänslig; skiljetecken och radbrytningar ignoreras vid poängsättning men bevaras i den markerade vyn nedan.

Buy Me a Coffee at ko-fi.com
Bearbetar... 0%
Tokenisera båda texterna till ord
Computing n-gram Jaccard likhet
Justera texter med en LCS på ordnivå
Återger höjdpunkter med matchade ord

Resultat

Det här verktyget jämför två texter som du klistrar in med hjälp av två oberoende, verkliga, väldokumenterade algoritmer – inte en vag "liknande" heuristik. Den första är n-gram Jaccard-likhet: varje text är tokeniserad till ord och delas sedan upp i överlappande serier av n på varandra följande ord (ett n-gram; standard är n=3, ett trigram, och du kan justera det från 1 till 5). Jaccard-indexet för de två resulterande n-gram-uppsättningarna - storleken på deras skärningspunkt dividerat med storleken på deras förening - är ett standarduppsättningsbaserat likhetsmått som används över informationshämtning och nästan duplikatdetektering. Ett högre n fångar längre delad frasering och är striktare när det gäller exakta formuleringar; ett lägre n är mer förlåtande och fångar lös ordöverlappning även mellan olika strukturerade meningar.

Den andra algoritmen är en äkta ord-nivå Longest Common Subsequence (LCS), beräknad med en verklig O(n·m) dynamisk programmeringstabell över de två ordsekvenserna - samma läroboksalgoritm som används av diff-verktyg, inte en approximation. Till skillnad från n-gram-poängen kräver LCS inte att matchade ord är sammanhängande, så det fångar överlappning även när en mening har omordnats eller lätt redigerats mellan delade fraser. Överlappningsprocenten härleds från LCS-längden i förhållande till medellängden för båda texterna. DP-tabellen backas sedan tillbaka för att identifiera exakt vilka ord i varje text som deltog i den längsta vanliga sekvensen, och detta är den utmärkande egenskapen: dessa ord mappas tillbaka till din ursprungliga text - med dess ursprungliga mellanrum, radbrytningar och skiljetecken intakta - och renderas som markerade intervall sida vid sida, så att du kan se exakt vilka stycken som överlappar varandra istället för att lita på.

Omfattning och ärlighet spelar roll här: det här är ett jämförelseverktyg med två texter, inte en plagiatdetektor. Den har ingen internetanslutning, inget sökindex och ingen databas med andras innehåll att kontrollera mot – det kan bara berätta hur lika de två texterna du klistrar in är varandra. Det gör den väl lämpad för att jämföra utkast till revisioner, kontrollera hur mycket en omskrivning eller omskrivning faktiskt har förändrats, eller upptäcka nästan duplicerat innehåll på dina egna sidor. Ordmatchning är skiftlägesokänslig, och O(n·m) LCS-tabellen är begränsad till några miljoner ordparceller — för mycket stora texter (ungefär några tusen ord kombinerat) hoppas det exakta LCS- och framhävningssteget över med en anteckning i vanligt språk, medan n-gram Jaccard-poängen, som bara kostar linjär tid, alltid beräknas på hela texten. Allt körs lokalt i din webbläsare; ingen av texterna lämnar din enhet.