पीडीएफ से मार्कडाउन कनवर्टर
पीडीएफ के पाठ को संरचित मार्कडाउन के रूप में निकालें: फ़ॉन्ट आकार से वास्तविक शीर्षक का पता लगाना, गोलियों और इंडेंट से सूची का पता लगाना - पाठ की एक सपाट दीवार नहीं।
नतीजा
एक सादा "पीडीएफ टू टेक्स्ट" डंप आपको बिना किसी आकार के प्रत्येक शब्द देता है: एक पृष्ठ का शीर्षक बिल्कुल फुटनोट की तरह पढ़ता है, और एक बुलेटेड सूची एक रन-ऑन वाक्य में बदल जाती है। यह टूल पीडीएफ से प्रत्येक टेक्स्ट आइटम के वास्तविक फ़ॉन्ट आकार और स्थिति को पढ़कर एक कदम आगे बढ़ता है - उसी पीडीएफ.जेएस इंजन के माध्यम से जो इस साइट के अन्य पीडीएफ टूल का उपयोग करता है - और संरचना के पुनर्निर्माण के लिए उस दृश्य साक्ष्य का उपयोग करता है: शीर्षक, सूची आइटम और पैराग्राफ, मार्कडाउन के रूप में लिखे गए।
यह पता लगाना वास्तव में माप-आधारित है, न कि अनुमान के आधार पर। किसी पृष्ठ पर टेक्स्ट आइटम को पंक्तियों में समूहीकृत किया जाता है कि उनकी ऊर्ध्वाधर स्थिति कितनी करीब है, प्रत्येक पंक्ति के फ़ॉन्ट आकार की गणना उसके स्वयं के टेक्स्ट-रेंडरिंग मैट्रिक्स से की जाती है, और उस आकार की तुलना पूरे दस्तावेज़ के लिए मध्य रेखा आकार से की जाती है - वह आकार जो अधिकांश लाइनें वास्तव में उपयोग करती हैं, यानी सामान्य मुख्य पाठ। उस माध्यिका से काफ़ी बड़ी रेखा मार्कडाउन शीर्षक बन जाती है (सबसे बड़ी रेखाएँ # बन जाती हैं, मामूली बड़ी रेखाएँ ## बन जाती हैं); एक पंक्ति जो बुलेट वर्ण से शुरू होती है या आसपास की रेखाओं के पीछे इंडेंट करती है वह `-` सूची आइटम बन जाती है; बाकी सभी चीजों को मुख्य पाठ के रूप में माना जाता है और पैराग्राफ में विलय कर दिया जाता है।
यह ईमानदारी से एक अनुमान है, संरचनात्मक पार्सर नहीं: पीडीएफ फाइलों में कोई गारंटीकृत सिमेंटिक मार्कअप नहीं होता है, स्याही कहां जाती है, इसके लिए केवल दृश्य निर्देश होते हैं, इसलिए एक डिजाइनर की असामान्य फ़ॉन्ट पसंद कभी-कभी आकार की तुलना को मूर्ख बना सकती है, और टेबल स्पष्ट रूप से दायरे से बाहर हैं - सेल लेआउट किसी भी विश्वसनीय तरीके से शीर्षकों, सूचियों या पैराग्राफ तक कम नहीं होते हैं, और यह टूल अन्यथा दिखावा नहीं करता है। प्रत्येक पृष्ठ को आउटपुट में "पेज एन" डिवाइडर के साथ स्पष्ट रूप से चिह्नित किया गया है, जो इस साइट के पीडीएफ-टू-टेक्स्ट टूल द्वारा उपयोग की जाने वाली परंपरा से मेल खाता है।
स्कैन किए गए पेजों को इस साइट पर अन्य जगहों की तरह ही ईमानदार व्यवहार मिलता है: एक पेज जो वास्तव में सिर्फ कागज की एक तस्वीर है, उसमें कोई टेक्स्ट परत नहीं होती है, इसलिए चुपचाप एक खाली अनुभाग बनाने के बजाय, टूल वास्तव में उन पेजों को नोट करता है जो वह पढ़ नहीं सका और उनके लिए इमेज टू टेक्स्ट (ओसीआर) टूल को इंगित करता है। आपके ब्राउज़र में सब कुछ स्थानीय रूप से चलता है - कुछ भी अपलोड नहीं किया गया है, कोई पृष्ठ सीमा नहीं है, और परिणाम एक टेक्स्ट बॉक्स में आता है जिसे आप .md फ़ाइल के रूप में कॉपी या सहेज सकते हैं जो किसी भी मार्कडाउन-जागरूक संपादक में खुलता है।