0

Pretvornik PDF v Markdown

Ekstrahirajte besedilo PDF-ja kot strukturirano označevanje: zaznavanje resničnega naslova glede na velikost pisave, zaznavanje seznama glede na oznake in zamik – ne ena ravna stena besedila.

📑

Povleci in spusti dokument PDF tukaj

ali Kliknite za brskanje po datotekah PDF

Buy Me a Coffee at ko-fi.com
Obdelava ... 0%
Nalaganje PDF-ja
Ekstrahiranje besedila s položaji
Zaznavanje naslovov in strukture
Končano

Rezultat

Navadni izpis »PDF v besedilo« vam ponuja vsako besedo brez kakršne koli oblike: naslov strani se bere natanko tako kot sprotna opomba, seznam z oznakami pa se spremeni v zaporedni stavek. To orodje gre še korak dlje, tako da prebere dejansko velikost in položaj pisave vsake besedilne postavke iz PDF-ja – prek istega mehanizma pdf.js, ki ga uporabljajo druga orodja za PDF na tem spletnem mestu – in uporabi ta vizualni dokaz za rekonstrukcijo strukture: naslovi, elementi seznama in odstavki, zapisani kot Markdown.

Zaznavanje resnično temelji na meritvah in ne na ugibanju. Besedilni elementi na strani so razvrščeni v vrstice glede na to, kako blizu so njihovi navpični položaji, velikost pisave vsake vrstice se izračuna iz lastne matrike za upodabljanje besedila in ta velikost se primerja s srednjo velikostjo črte za celoten dokument – ​​velikostjo, ki jo večina vrstic dejansko uporablja, tj. običajno telo besedila. Črta, ki je opazno večja od te mediane, postane naslov Markdown (največje črte postanejo #, zmerno večje postanejo ##); vrstica, ki se začne z oznako ali je zamaknjena mimo okoliških vrstic, postane postavka seznama `-`; vse ostalo je obravnavano kot telo besedila in združeno v odstavke.

To je pošteno hevristika, ne strukturni razčlenjevalnik: datoteke PDF nimajo zajamčenih semantičnih oznak, le vizualna navodila, kam gre črnilo, tako da lahko oblikovalčeve nenavadne izbire pisave občasno zavedejo primerjavo velikosti, tabele pa so izrecno izven obsega – postavitve celic se ne zmanjšajo na naslove, sezname ali odstavke na noben zanesljiv način in to orodje se ne pretvarja, da je drugače. Vsaka stran je v izpisu jasno označena z delilnikom »Stran N«, kar se ujema s konvencijo, ki jo uporablja orodje za pretvorbo PDF v besedilo tega spletnega mesta.

Optično prebrane strani so deležne enake poštene obravnave kot drugje na tem spletnem mestu: stran, ki je v resnici le fotografija papirja, sploh nima besedilne plasti, zato orodje namesto tihega ustvarjanja praznega odseka natančno zabeleži, katerih strani ni moglo prebrati, in zanje pokaže na orodje Image to Text (OCR). Vse se izvaja lokalno v vašem brskalniku – nič se ne naloži, ni omejitev strani in rezultat pristane v besedilnem polju, ki ga lahko kopirate ali shranite kot datoteko .md, ki se odpre v katerem koli urejevalniku, ki podpira Markdown.