0

בודק דמיון טקסטים

השוו בין שני טקסטים בעזרת דמיון Jaccard אמיתי על n-גרמות וציון חפיפה LCS ברמת המילה, עם הקטעים התואמים מודגשים זה לצד זה.

🔒 מעובד כולו בדפדפן שלך - שום דבר שתזין כאן לא יועלה לעולם.

כלי זה רק משווה את שני הטקסטים שתדביקו כאן — אין לו חיבור לאינטרנט, אינדקס חיפוש או מסד נתונים של תוכן, כך שהוא אינו יכול לבדוק גניבה ספרותית מול דפי אינטרנט אחרים. ההתאמה אינה תלויה ברישיות; סימני פיסוק וירידות שורה מתעלמים מהם לצורך הניקוד אך נשמרים בתצוגה המודגשת למטה.

מעבד... 0%
מפרק את שני הטקסטים למילים
מחשב דמיון Jaccard על n-גרמות
מיישר טקסטים בעזרת LCS ברמת המילה
מציג הדגשת מילים תואמות

תוצאה

כלי זה משווה שני טקסטים שתדביקו באמצעות שני אלגוריתמים בלתי תלויים, אמיתיים ומתועדים היטב — לא היוריסטיקה מעורפלת של ״נראה דומה״. הראשון הוא דמיון Jaccard על n-גרמות: כל טקסט מפורק למילים, ואז מחולק לרצפים חופפים של n מילים עוקבות (n-גרמה; ברירת המחדל היא n=3, טריגרמה, וניתן לכוונן מ-1 עד 5). מדד Jaccard של שתי קבוצות ה-n-גרמות המתקבלות — גודל החיתוך שלהן חלקי גודל האיחוד שלהן — הוא מדד דמיון מבוסס קבוצות סטנדרטי, הנמצא בשימוש באחזור מידע וזיהוי כפילויות. n גבוה יותר לוכד ביטויים משותפים ארוכים יותר ומחמיר יותר לגבי הניסוח המדויק; n נמוך יותר סלחני יותר ולוכד חפיפת מילים רופפת אפילו בין משפטים בעלי מבנה שונה.

האלגוריתם השני הוא תת-הרצף המשותף הארוך ביותר (LCS) אמיתי ברמת המילה, המחושב בעזרת טבלת תכנות דינמי אמיתית ב־O(n·m) על שני רצפי המילים — אותו אלגוריתם מספרי לימוד שמשמש כלי diff, לא קירוב. בניגוד לציון ה-n-גרמות, ה-LCS אינו דורש שהמילים התואמות יהיו רציפות, כך שהוא לוכד חפיפה גם כאשר משפט סודר מחדש או נערך קלות בין ביטויים משותפים. אחוז החפיפה נגזר מאורך ה-LCS ביחס לאורך הממוצע של שני הטקסטים. לאחר מכן מתבצע מעקב לאחור בטבלת התכנות הדינמי כדי לזהות בדיוק אילו מילים בכל טקסט השתתפו באותו רצף משותף ארוך ביותר, וזוהי התכונה הבולטת: מילים אלה ממופות חזרה אל הטקסט המקורי שלכם — עם הרווחים, ירידות השורה וסימני הפיסוק המקוריים ללא פגע — ומוצגות כמקטעים מודגשים זה לצד זה, כך שתוכלו לראות בדיוק אילו קטעים חופפים במקום להסתמך על מספר יבש.

היקף וכנות חשובים כאן: זהו כלי להשוואת שני טקסטים, לא גלאי גניבה ספרותית. אין לו חיבור לאינטרנט, אין לו אינדקס חיפוש, ואין לו מסד נתונים של תוכן של אנשים אחרים לבדוק מולו — הוא יכול רק לומר לכם עד כמה שני הטקסטים שהדבקתם דומים זה לזה. זה הופך אותו למתאים במיוחד להשוואת טיוטות, בדיקה עד כמה פרפרזה או שכתוב באמת שינו, או איתור תוכן כמעט-כפול בין הדפים שלכם. התאמת מילים אינה תלויה ברישיות, וטבלת ה-LCS ב־O(n·m) מוגבלת לכמה מיליוני תאי צמדי-מילים — עבור טקסטים גדולים מאוד (בערך כמה אלפי מילים משולבים) שלב ה-LCS המדויק וההדגשה מדולגים עם הערה בשפה פשוטה, בעוד ציון Jaccard על n-גרמות, שעולה רק זמן ליניארי, תמיד מחושב על הטקסט המלא. הכל רץ מקומית בדפדפן שלכם; אף טקסט לא עוזב את המכשיר שלכם לעולם.