0

पाठ समानता जांचकर्ता

वास्तविक एन-ग्राम जैककार्ड समानता और एक शब्द-स्तरीय एलसीएस ओवरलैप स्कोर वाले दो पाठों की तुलना करें, साथ ही मेल खाने वाले अंशों को एक साथ हाइलाइट करें।

यह टूल केवल आपके द्वारा यहां चिपकाए गए दो टेक्स्ट की तुलना करता है - इसमें कोई इंटरनेट कनेक्शन, खोज सूचकांक या सामग्री डेटाबेस नहीं है, इसलिए यह अन्य वेब पेजों के विरुद्ध साहित्यिक चोरी की जांच नहीं कर सकता है। मिलान केस-असंवेदनशील है; स्कोरिंग करते समय विराम चिह्न और पंक्ति विराम को नजरअंदाज कर दिया जाता है लेकिन नीचे हाइलाइट किए गए दृश्य में संरक्षित किया जाता है।

Buy Me a Coffee at ko-fi.com
प्रसंस्करण... 0%
दोनों पाठों को शब्दों में अंकित करना
एन-ग्राम जैककार्ड समानता की गणना
शब्दों को शब्द-स्तरीय एलसीएस के साथ संरेखित करना
मिलान-शब्द हाइलाइट्स प्रस्तुत करना

नतीजा

यह टूल दो स्वतंत्र, वास्तविक, अच्छी तरह से प्रलेखित एल्गोरिदम का उपयोग करके आपके द्वारा पेस्ट किए गए दो पाठों की तुलना करता है - अस्पष्ट "समान दिखने वाला" अनुमान नहीं। पहला एन-ग्राम जैकार्ड समानता है: प्रत्येक पाठ को शब्दों में टोकन किया जाता है, फिर एन लगातार शब्दों के ओवरलैपिंग रन में विभाजित किया जाता है (एक एन-ग्राम; डिफ़ॉल्ट एन = 3 है, एक ट्रिग्राम, और आप इसे 1 से 5 तक समायोजित कर सकते हैं)। दो परिणामी एन-ग्राम सेटों का जैकार्ड इंडेक्स - उनके चौराहे का आकार उनके संघ के आकार से विभाजित होता है - एक मानक सेट-आधारित समानता माप है जिसका उपयोग सूचना पुनर्प्राप्ति और निकट-डुप्लिकेट पहचान में किया जाता है। एक उच्चतर एन लंबे समय तक साझा किए गए वाक्यांशों को पकड़ता है और सटीक शब्दों के बारे में सख्त होता है; निचला n अधिक क्षमाशील है और अलग-अलग संरचित वाक्यों के बीच भी ढीले शब्द-ओवरलैप को पकड़ता है।

दूसरा एल्गोरिदम एक वास्तविक शब्द-स्तर का सबसे लंबा सामान्य अनुक्रम (एलसीएस) है, जिसकी गणना दो शब्द अनुक्रमों पर एक वास्तविक ओ (एनएम) गतिशील-प्रोग्रामिंग तालिका के साथ की जाती है - समान पाठ्यपुस्तक एल्गोरिदम का उपयोग अलग-अलग टूल द्वारा किया जाता है, सन्निकटन नहीं। एन-ग्राम स्कोर के विपरीत, एलसीएस को मिलान किए गए शब्दों को सन्निहित होने की आवश्यकता नहीं होती है, इसलिए यह तब भी ओवरलैप को पकड़ लेता है जब किसी वाक्य को साझा वाक्यांशों के बीच में पुन: व्यवस्थित या हल्के ढंग से संपादित किया गया हो। ओवरलैप प्रतिशत दोनों पाठों की औसत लंबाई के सापेक्ष एलसीएस लंबाई से प्राप्त होता है। फिर डीपी तालिका को सटीक रूप से पहचानने के लिए बैकट्रैक किया जाता है कि प्रत्येक पाठ में कौन से शब्द उस सबसे लंबे सामान्य अनुक्रम में भाग लेते हैं, और यह असाधारण विशेषता है: उन शब्दों को आपके मूल पाठ पर वापस मैप किया जाता है - इसकी मूल रिक्ति, लाइन ब्रेक और विराम चिह्न बरकरार के साथ - और साथ-साथ हाइलाइट किए गए स्पैन के रूप में प्रस्तुत किया जाता है, ताकि आप देख सकें कि कौन से मार्ग एक खाली संख्या पर भरोसा करने के बजाय ओवरलैप होते हैं।

यहां दायरा और ईमानदारी मायने रखती है: यह दो-पाठ तुलना उपकरण है, साहित्यिक चोरी डिटेक्टर नहीं। इसमें कोई इंटरनेट कनेक्शन नहीं है, कोई खोज सूचकांक नहीं है, और जांच करने के लिए अन्य लोगों की सामग्री का कोई डेटाबेस नहीं है - यह आपको केवल यह बता सकता है कि आपके द्वारा चिपकाए गए दो पाठ एक-दूसरे से कितने समान हैं। यह ड्राफ्ट संशोधनों की तुलना करने, यह जाँचने के लिए उपयुक्त है कि वास्तव में एक पैराफ़्रेज़ या पुनर्लेखन कितना बदल गया है, या अपने स्वयं के पृष्ठों पर लगभग डुप्लिकेट सामग्री का पता लगाना। शब्द मिलान केस-असंवेदनशील है, और O(n·m) LCS तालिका को कुछ मिलियन शब्द-जोड़ी कोशिकाओं पर कैप किया गया है - बहुत बड़े पाठों के लिए (लगभग कुछ हजार शब्द संयुक्त) सटीक LCS और हाइलाइटिंग चरण को एक सादे-भाषा नोट के साथ छोड़ दिया जाता है, जबकि एन-ग्राम जैकार्ड स्कोर, जिसमें केवल रैखिक समय खर्च होता है, की गणना हमेशा पूर्ण पाठ पर की जाती है। आपके ब्राउज़र में सब कुछ स्थानीय रूप से चलता है; कोई भी टेक्स्ट आपके डिवाइस को कभी नहीं छोड़ता।