PDF से मार्कडाउन कनवर्टर
PDF का टेक्स्ट संरचित मार्कडाउन के रूप में निकालें: फ़ॉन्ट आकार से वास्तविक शीर्षक पहचान, बुलेट और इंडेंट से सूची पहचान — टेक्स्ट की कोई सपाट दीवार नहीं।
🔒 पूरी तरह से आपके ब्राउज़र में संसाधित - आपके द्वारा यहां दर्ज की गई कोई भी चीज़ कभी भी अपलोड नहीं की जाती है।
परिणाम
एक सादा "PDF से टेक्स्ट" डंप आपको हर शब्द तो देता है, लेकिन आकार खो देता है: एक पृष्ठ का शीर्षक बिल्कुल फ़ुटनोट जैसा पढ़ा जाता है, और एक बुलेटेड सूची एक निरंतर वाक्य बन जाती है। यह उपकरण प्रत्येक टेक्स्ट आइटम के वास्तविक फ़ॉन्ट आकार और स्थिति को PDF से पढ़कर — उसी pdf.js इंजन के माध्यम से जिसका उपयोग इस साइट के अन्य PDF उपकरण करते हैं — एक कदम आगे बढ़ता है और उस दृश्य प्रमाण का उपयोग करके संरचना का पुनर्निर्माण करता है: शीर्षक, सूची आइटम और पैराग्राफ़, जो मार्कडाउन के रूप में लिखे जाते हैं।
पहचान वास्तव में माप-आधारित है, कोई अनुमान नहीं जिसे सजाया गया हो। किसी पृष्ठ पर टेक्स्ट आइटम को उनकी ऊर्ध्वाधर स्थितियाँ कितनी पास हैं, इसके आधार पर पंक्तियों में समूहीकृत किया जाता है, प्रत्येक पंक्ति का फ़ॉन्ट आकार उसके अपने टेक्स्ट-रेंडरिंग मैट्रिक्स से परिकलित किया जाता है, और उस आकार की तुलना पूरे दस्तावेज़ के मध्य पंक्ति आकार से की जाती है — वह आकार जो अधिकांश पंक्तियाँ वास्तव में उपयोग करती हैं, यानी सामान्य मुख्य टेक्स्ट। उस मध्य आकार से स्पष्ट रूप से बड़ी कोई पंक्ति मार्कडाउन शीर्षक बन जाती है (सबसे बड़ी पंक्तियाँ # बनती हैं, मध्यम रूप से बड़ी ## बनती हैं); एक पंक्ति जो बुलेट वर्ण से शुरू होती है या आस-पास की पंक्तियों से अधिक इंडेंटेड बैठती है, वह `- ` सूची आइटम बन जाती है; बाकी सब कुछ मुख्य टेक्स्ट माना जाता है और पैराग्राफ़ में विलय कर दिया जाता है।
यह ईमानदारी से एक अनुमान है, कोई संरचनात्मक पार्सर नहीं: PDF फ़ाइलों में कोई गारंटीकृत सिमैंटिक मार्कअप नहीं होता, केवल दृश्य निर्देश होते हैं कि स्याही कहाँ जाएगी, इसलिए डिज़ाइनर की असामान्य फ़ॉन्ट पसंद कभी-कभी आकार की तुलना को चकमा दे सकती है, और तालिकाएँ स्पष्ट रूप से दायरे से बाहर हैं — सेल लेआउट किसी भी विश्वसनीय तरीके से शीर्षकों, सूचियों या पैराग्राफ़ में नहीं बदलते, और यह उपकरण अन्यथा दिखावा नहीं करता। आउटपुट में प्रत्येक पृष्ठ को "पृष्ठ N" विभाजक से स्पष्ट रूप से चिह्नित किया जाता है, जो इस साइट के PDF-से-टेक्स्ट उपकरण द्वारा उपयोग की जाने वाली परिपाटी से मेल खाता है।
स्कैन किए गए पृष्ठों को वही ईमानदार उपचार मिलता है जो इस साइट पर अन्यत्र है: एक पृष्ठ जो वास्तव में केवल कागज़ की तस्वीर है, उसमें कोई टेक्स्ट लेयर ही नहीं होती, इसलिए चुपचाप एक खाली अनुभाग बनाने के बजाय, उपकरण ठीक-ठीक नोट करता है कि कौन से पृष्ठ पढ़ नहीं सका और उनके लिए छवि से टेक्स्ट (OCR) उपकरण की ओर इशारा करता है। सब कुछ आपके ब्राउज़र में स्थानीय रूप से चलता है — कुछ भी अपलोड नहीं किया जाता, कोई पृष्ठ सीमा नहीं है, और परिणाम एक टेक्स्ट बॉक्स में आता है जिसे आप कॉपी कर सकते हैं या .md फ़ाइल के रूप में सहेज सकते हैं जो किसी भी मार्कडाउन-जागरूक संपादक में खुलती है।