Text-Ähnlichkeitsprüfung
Vergleichen Sie zwei Texte mit echter n-Gramm-Jaccard-Ähnlichkeit und einem Wort-LCS-Überlappungswert, wobei die übereinstimmenden Passagen nebeneinander hervorgehoben werden.
🔒 Wird vollständig in Ihrem Browser verarbeitet – nichts, was Sie hier eingeben, wird jemals hochgeladen.
Ergebnis
Dieses Werkzeug vergleicht zwei von Ihnen eingefügte Texte anhand zweier unabhängiger, echter und gut dokumentierter Algorithmen – keine vage „sieht ähnlich aus“-Heuristik. Der erste ist die n-Gramm-Jaccard-Ähnlichkeit: Jeder Text wird in Wörter zerlegt und dann in überlappende Läufe von n aufeinanderfolgenden Wörtern aufgeteilt (ein n-Gramm; Standard ist n=3, ein Trigramm, einstellbar von 1 bis 5). Der Jaccard-Index der beiden resultierenden n-Gramm-Mengen – die Größe ihrer Schnittmenge geteilt durch die Größe ihrer Vereinigungsmenge – ist ein standardisiertes mengenbasiertes Ähnlichkeitsmaß, das im Information Retrieval und bei der Erkennung von Fast-Duplikaten verwendet wird. Ein höheres n erfasst längere gemeinsame Formulierungen und ist strenger bei exaktem Wortlaut; ein niedrigeres n ist verzeihender und findet lose Wortüberlappungen selbst zwischen unterschiedlich strukturierten Sätzen.
Der zweite Algorithmus ist eine echte wörtliche Längste gemeinsame Teilfolge (LCS), berechnet mit einer echten O(n·m) DP-Tabelle über die beiden Wortfolgen – derselbe Lehrbuchalgorithmus, den Diff-Werkzeuge verwenden, keine Näherung. Anders als der n-Gramm-Score verlangt die LCS nicht, dass übereinstimmende Wörter zusammenhängend sind; sie erfasst daher Überlappungen auch dann, wenn ein Satz umgestellt oder zwischen gemeinsamen Phrasen leicht bearbeitet wurde. Der Überlappungsprozentsatz ergibt sich aus der LCS-Länge im Verhältnis zur durchschnittlichen Länge beider Texte. Die DP-Tabelle wird dann per Backtracking durchlaufen, um genau zu bestimmen, welche Wörter in jedem Text an dieser längsten gemeinsamen Folge teilnahmen – und das ist das herausragende Merkmal: Diese Wörter werden auf Ihren Originaltext – mit dessen ursprünglichen Abständen, Zeilenumbrüchen und Zeichensetzung – zurückgeführt und als hervorgehobene Bereiche nebeneinander dargestellt, sodass Sie genau sehen können, welche Passagen sich überschneiden, anstatt einer bloßen Zahl vertrauen zu müssen.
Umfang und Ehrlichkeit sind hier wichtig: Dies ist ein Werkzeug zum Vergleich zweier Texte, kein Plagiatsdetektor. Es hat keine Internetverbindung, keinen Suchindex und keine Datenbank mit fremden Inhalten, gegen die es prüfen könnte – es kann Ihnen immer nur sagen, wie ähnlich sich die beiden von Ihnen eingefügten Texte sind. Das macht es besonders geeignet, um Entwurfsfassungen zu vergleichen, zu prüfen, wie sehr eine Paraphrase oder Umschreibung tatsächlich verändert wurde, oder um fast doppelte Inhalte auf Ihren eigenen Seiten zu erkennen. Wortabgleich erfolgt ohne Beachtung der Groß-/Kleinschreibung, und die O(n·m)-LCS-Tabelle ist auf wenige Millionen Wortpaarzellen begrenzt – bei sehr großen Texten (zusammen etwa einige tausend Wörter) wird der exakte LCS- und Hervorhebungsschritt mit einem verständlichen Hinweis übersprungen, während der n-Gramm-Jaccard-Score, der nur lineare Zeit kostet, stets für den gesamten Text berechnet wird. Alles läuft lokal in Ihrem Browser; keiner der Texte verlässt Ihr Gerät.