0

टेक्स्ट समानता परीक्षक

वास्तविक n-gram Jaccard समानता और शब्द-स्तरीय LCS ओवरलैप स्कोर के साथ दो टेक्स्ट की तुलना करें, जिसमें मेल खाने वाले अंश साथ-साथ हाइलाइट किए गए हों।

🔒 पूरी तरह से आपके ब्राउज़र में संसाधित - आपके द्वारा यहां दर्ज की गई कोई भी चीज़ कभी भी अपलोड नहीं की जाती है।

यह उपकरण केवल उन दो टेक्स्ट की तुलना करता है जो आप यहाँ चिपकाते हैं — इसका कोई इंटरनेट कनेक्शन, खोज सूचकांक या सामग्री डेटाबेस नहीं है, इसलिए यह अन्य वेब पृष्ठों के विरुद्ध साहित्यिक चोरी की जाँच नहीं कर सकता है। मिलान केस-असंवेदी है; स्कोर करते समय विराम चिह्न और पंक्ति विच्छेद अनदेखे किए जाते हैं लेकिन नीचे हाइलाइट किए गए दृश्य में संरक्षित रहते हैं।

प्रोसेस हो रहा है... 0%
दोनों टेक्स्ट को शब्दों में टोकनाइज़ किया जा रहा है
n-gram Jaccard समानता की गणना की जा रही है
शब्द-स्तरीय LCS के साथ टेक्स्ट संरेखित किए जा रहे हैं
मिलान-शब्द हाइलाइट रेंडर किए जा रहे हैं

परिणाम

यह उपकरण आपके द्वारा चिपकाए गए दो टेक्स्ट की तुलना दो स्वतंत्र, वास्तविक, सुपरिचित एल्गोरिदम का उपयोग करके करता है — न कि किसी अस्पष्ट "एक जैसा लगता है" अनुमान से। पहला n-gram Jaccard समानता है: प्रत्येक टेक्स्ट को शब्दों में टोकनाइज़ किया जाता है, फिर n क्रमागत शब्दों के ओवरलैपिंग रनों में विभाजित किया जाता है (एक n-gram; डिफ़ॉल्ट n=3, एक ट्राइग्राम है, और आप इसे 1 से 5 तक समायोजित कर सकते हैं)। दो परिणामी n-gram सेटों का Jaccard सूचकांक — उनके प्रतिच्छेदन के आकार को उनके संघ के आकार से विभाजित करना — सूचना पुनर्प्राप्ति और नियर-डुप्लिकेट पहचान में उपयोग किया जाने वाला एक मानक सेट-आधारित समानता माप है। एक उच्च n लंबे साझा वाक्यांशों को पकड़ता है और सटीक शब्दों के बारे में अधिक सख्त होता है; एक निचला n अधिक क्षमाशील होता है और भिन्न रूप से संरचित वाक्यों के बीच भी ढीले शब्द-ओवरलैप को पकड़ता है।

दूसरा एल्गोरिदम एक वास्तविक शब्द-स्तरीय दीर्घतम उभयनिष्ठ अनुवर्ती (LCS) है, जिसकी गणना दो शब्द अनुक्रमों पर एक वास्तविक O(n·m) डायनामिक-प्रोग्रामिंग तालिका के साथ की जाती है — वही पाठ्यपुस्तक एल्गोरिदम जो diff उपकरणों द्वारा उपयोग किया जाता है, कोई सन्निकटन नहीं। n-gram स्कोर के विपरीत, LCS को मिलान वाले शब्दों के सन्निहित होने की आवश्यकता नहीं होती है, इसलिए यह ओवरलैप को तब भी पकड़ता है जब किसी वाक्य को पुनर्व्यवस्थित किया गया हो या साझा वाक्यांशों के बीच हल्के ढंग से संपादित किया गया हो। ओवरलैप प्रतिशत LCS लंबाई से दोनों टेक्स्ट की औसत लंबाई के सापेक्ष प्राप्त किया जाता है। फिर DP तालिका को पीछे खोजकर ठीक-ठीक पहचाना जाता है कि प्रत्येक टेक्स्ट के कौन से शब्द उस दीर्घतम उभयनिष्ठ अनुक्रम में शामिल हुए, और यह विशिष्ठ विशेषता है: उन शब्दों को आपके मूल टेक्स्ट पर वापस मैप किया जाता है — इसकी मूल रिक्ति, पंक्ति विच्छेद और विराम चिह्नों को अक्षुण्ण रखते हुए — और साथ-साथ हाइलाइट किए गए स्पैन के रूप में रेंडर किया जाता है, ताकि आप एक मात्र संख्या पर भरोसा करने के बजाय ठीक-ठीक देख सकें कि कौन से अंश ओवरलैप होते हैं।

यहाँ दायरा और ईमानदारी मायने रखती है: यह एक दो-टेक्स्ट तुलना उपकरण है, कोई साहित्यिक चोरी डिटेक्टर नहीं। इसका कोई इंटरनेट कनेक्शन नहीं है, कोई खोज सूचकांक नहीं है, और जाँच के लिए अन्य लोगों की सामग्री का कोई डेटाबेस नहीं है — यह केवल यह बता सकता है कि आपके द्वारा चिपकाए गए दो टेक्स्ट एक-दूसरे से कितने समान हैं। यह इसे मसौदा संशोधनों की तुलना करने, यह जाँचने के लिए उपयुक्त बनाता है कि किसी व्याख्या या पुनर्लेखन ने वास्तव में कितना बदलाव किया, या अपने स्वयं के पृष्ठों पर नियर-डुप्लिकेट सामग्री का पता लगाने के लिए। शब्द मिलान केस-असंवेदी है, और O(n·m) LCS तालिका कुछ मिलियन शब्द-युग्म कक्षों पर सीमित है — बहुत बड़े टेक्स्ट (लगभग कुछ हज़ार शब्द संयुक्त) के लिए सटीक LCS और हाइलाइटिंग चरण को एक सरल-भाषा नोट के साथ छोड़ दिया जाता है, जबकि n-gram Jaccard स्कोर, जिसमें केवल रैखिक समय लगता है, हमेशा पूर्ण टेक्स्ट पर गणना किया जाता है। सब कुछ स्थानीय रूप से आपके ब्राउज़र में चलता है; कोई भी टेक्स्ट कभी भी आपके डिवाइस को नहीं छोड़ता है।