Μετατροπέας PDF σε Markdown
Εξαγωγή κειμένου PDF ως δομημένο Markdown: ανίχνευση πραγματικής επικεφαλίδας από το μέγεθος γραμματοσειράς, ανίχνευση λίστας από κουκκίδες και εσοχή — όχι ένα επίπεδο τοίχωμα κειμένου.
Αποτέλεσμα
Μια απλή ένδειξη "PDF σε κείμενο" σάς δίνει κάθε λέξη χωρίς το σχήμα: ένας τίτλος σελίδας διαβάζεται ακριβώς όπως μια υποσημείωση και μια λίστα με κουκκίδες μετατρέπεται σε εκτεταμένη πρόταση. Αυτό το εργαλείο προχωρά ένα βήμα παραπέρα διαβάζοντας το πραγματικό μέγεθος γραμματοσειράς και τη θέση κάθε στοιχείου κειμένου από το PDF — μέσω της ίδιας μηχανής pdf.js που χρησιμοποιούν τα άλλα εργαλεία PDF αυτού του ιστότοπου — και χρησιμοποιώντας αυτά τα οπτικά στοιχεία για την ανακατασκευή της δομής: επικεφαλίδες, στοιχεία λίστας και παραγράφους, γραμμένες ως Markdown.
Η ανίχνευση βασίζεται πραγματικά σε μετρήσεις, όχι μια εικασία που ντύνεται σαν μια εικασία. Τα στοιχεία κειμένου σε μια σελίδα ομαδοποιούνται σε γραμμές ανάλογα με το πόσο κοντινές είναι οι κατακόρυφες θέσεις τους, το μέγεθος γραμματοσειράς κάθε γραμμής υπολογίζεται από τη δική της μήτρα απόδοσης κειμένου και αυτό το μέγεθος συγκρίνεται με το διάμεσο μέγεθος γραμμής για ολόκληρο το έγγραφο — το μέγεθος που χρησιμοποιούν οι περισσότερες γραμμές, δηλαδή το συνηθισμένο κυρίως κείμενο. Μια γραμμή αισθητά μεγαλύτερη από αυτή τη διάμεσο γίνεται επικεφαλίδα Markdown (οι μεγαλύτερες γραμμές γίνονται #, οι μετρίως μεγαλύτερες γίνονται ##). μια γραμμή που ξεκινά με χαρακτήρα κουκκίδας ή βρίσκεται με εσοχή πέρα από τις γύρω γραμμές γίνεται "-" στοιχείο λίστας. οτιδήποτε άλλο αντιμετωπίζεται ως κύριο κείμενο και συγχωνεύεται σε παραγράφους.
Αυτό είναι ειλικρινά μια ευρετική, όχι μια δομική ανάλυση: τα αρχεία PDF δεν διαθέτουν εγγυημένη σημασιολογική σήμανση, μόνο οπτικές οδηγίες για το πού πηγαίνει το μελάνι, έτσι οι ασυνήθιστες επιλογές γραμματοσειράς ενός σχεδιαστή μπορούν περιστασιακά να ξεγελούν τη σύγκριση μεγεθών και οι πίνακες είναι ρητά εκτός πεδίου — οι διατάξεις κελιών δεν περιορίζονται σε επικεφαλίδες, λίστες ή παραγράφους. Κάθε σελίδα επισημαίνεται με σαφήνεια με ένα διαχωριστικό "Σελίδα N" στην έξοδο, που ταιριάζει με τη σύμβαση που χρησιμοποιείται από το εργαλείο PDF σε κείμενο αυτού του ιστότοπου.
Οι σαρωμένες σελίδες τυγχάνουν της ίδιας ειλικρινούς μεταχείρισης όπως αλλού σε αυτόν τον ιστότοπο: μια σελίδα που είναι στην πραγματικότητα απλώς μια φωτογραφία χαρτιού δεν έχει καθόλου επίπεδο κειμένου, επομένως, αντί να δημιουργεί σιωπηλά μια κενή ενότητα, το εργαλείο σημειώνει ακριβώς ποιες σελίδες δεν μπορούσε να διαβάσει και δείχνει το εργαλείο Image to Text (OCR) για αυτούς. Τα πάντα εκτελούνται τοπικά στο πρόγραμμα περιήγησής σας — τίποτα δεν μεταφορτώνεται, δεν υπάρχουν όρια σελίδων και το αποτέλεσμα καταλήγει σε ένα πλαίσιο κειμένου που μπορείτε να αντιγράψετε ή να αποθηκεύσετε ως αρχείο .md που ανοίγει σε οποιοδήποτε πρόγραμμα επεξεργασίας με γνώση Markdown.