Textähnlichkeitsprüfung
Vergleichen Sie zwei Texte mit echter N-Gramm-Jaccard-Ähnlichkeit und einem LCS-Überlappungsscore auf Wortebene, wobei die übereinstimmenden Passagen nebeneinander hervorgehoben werden.
Ergebnis
Dieses Tool vergleicht zwei Texte, die Sie einfügen, mithilfe zweier unabhängiger, realer und gut dokumentierter Algorithmen – nicht einer vagen „sieht ähnlich“-Heuristik aus. Die erste ist die N-Gramm-Jaccard-Ähnlichkeit: Jeder Text wird in Wörter unterteilt und dann in überlappende Reihen von n aufeinanderfolgenden Wörtern aufgeteilt (ein N-Gramm; der Standardwert ist n=3, ein Trigramm, und Sie können ihn von 1 bis 5 anpassen). Der Jaccard-Index der beiden resultierenden n-Gramm-Sätze – die Größe ihres Schnittpunkts dividiert durch die Größe ihrer Vereinigung – ist ein standardisiertes satzbasiertes Ähnlichkeitsmaß, das beim Informationsabruf und bei der Erkennung von nahezu Duplikaten verwendet wird. Ein höheres n erfasst längere gemeinsame Formulierungen und ist strenger hinsichtlich der genauen Formulierung; Ein niedrigeres n ist nachsichtiger und fängt lose Wortüberschneidungen auch zwischen unterschiedlich strukturierten Sätzen auf.
Der zweite Algorithmus ist eine echte Longest Common Subsequence (LCS) auf Wortebene, die mit einer echten O(n·m) dynamischen Programmiertabelle über die beiden Wortsequenzen berechnet wird – derselbe Lehrbuchalgorithmus, der von Diff-Tools verwendet wird, keine Näherung. Im Gegensatz zum N-Gramm-Score erfordert das LCS nicht, dass übereinstimmende Wörter zusammenhängend sind, sodass Überlappungen auch dann erfasst werden, wenn ein Satz zwischen gemeinsamen Phrasen neu angeordnet oder leicht bearbeitet wurde. Der Überlappungsprozentsatz ergibt sich aus der LCS-Länge im Verhältnis zur durchschnittlichen Länge beider Texte. Die DP-Tabelle wird dann zurückverfolgt, um genau zu identifizieren, welche Wörter in jedem Text an dieser längsten gemeinsamen Sequenz beteiligt waren. Das ist das herausragende Merkmal: Diese Wörter werden wieder Ihrem Originaltext zugeordnet – mit intakten Originalabständen, Zeilenumbrüchen und Zeichensetzung – und als hervorgehobene Abschnitte nebeneinander dargestellt, sodass Sie genau sehen können, welche Passagen sich überlappen, anstatt sich auf eine bloße Zahl zu verlassen.
Hier kommt es auf Umfang und Ehrlichkeit an: Es handelt sich um ein Zwei-Text-Vergleichstool und nicht um einen Plagiatsdetektor. Es verfügt über keine Internetverbindung, keinen Suchindex und keine Datenbank mit Inhalten anderer Personen, mit denen Sie vergleichen können – es kann Ihnen immer nur sagen, wie ähnlich die beiden von Ihnen eingefügten Texte einander sind. Dadurch eignet es sich gut zum Vergleichen von Entwurfsrevisionen, zum Überprüfen, wie sehr sich eine Paraphrase oder Neuformulierung tatsächlich geändert hat, oder zum Erkennen nahezu doppelter Inhalte auf Ihren eigenen Seiten. Beim Wortabgleich wird die Groß-/Kleinschreibung nicht beachtet, und die O(n·m)-LCS-Tabelle ist auf einige Millionen Wortpaarzellen begrenzt. Bei sehr großen Texten (ungefähr einige tausend Wörter zusammen) wird der genaue LCS- und Hervorhebungsschritt mit einer Klartext-Notiz übersprungen, während der n-Gramm-Jaccard-Score, der nur lineare Zeit kostet, immer für den Volltext berechnet wird. Alles läuft lokal in Ihrem Browser; Keiner der Texte verlässt jemals Ihr Gerät.