0

Pretvornik PDF v Markdown

Izvlecite besedilo PDF-ja kot strukturiran Markdown: resnično zaznavanje naslovov iz velikosti pisave, zaznavanje seznamov iz alinej in zamikov – ne pa enolične stene besedila.

🔒 V celoti obdelano v vašem brskalniku – nič, kar tukaj vnesete, ni nikoli naloženo.

📑

Povlecite in spustite dokument PDF sem

ali kliknite za brskanje po datotekah PDF

Obdelava ... 0%
Nalaganje PDF-ja
Pridobivanje besedila s položaji
Zaznavanje naslovov in strukture
Končano

Rezultat

Navaden izvoz »PDF v besedilo« vam da vsako besedo, a brez vsakršne oblike: naslov strani se bere povsem enako kot opomba, alinejni seznam pa se spremeni v tekoč stavek. To orodje gre korak dlje, saj prebere dejansko velikost pisave in položaj vsakega besedilnega elementa iz PDF-ja – z enakim pogonom pdf.js, ki ga uporabljajo druga orodja za PDF na tem spletnem mestu – in te vizualne dokaze uporabi za rekonstrukcijo strukture: naslove, elemente seznama in odstavke, zapisane v Markdownu.

Zaznavanje resnično temelji na meritvah, ne na ugibanju, ki se pretvarja, da je kaj drugega. Besedilni elementi na strani so združeni v vrstice glede na bližino njihovih navpičnih položajev; velikost pisave vsake vrstice je izračunana iz njene lastne matrike upodabljanja besedila, nato pa se ta velikost primerja s srednjo velikostjo vrstice za celoten dokument – to je velikost, ki jo dejansko uporablja večina vrstic, torej navadno besedilo. Vrstica, ki je občutno večja od te srednje vrednosti, postane naslov Markdown (največje vrstice postanejo #, zmerno večje pa ##); vrstica, ki se začne z znakom za alinejo ali je zamaknjena glede na okoliške vrstice, postane element seznama `- `; vse ostalo se obravnava kot besedilo in se združi v odstavke.

Odkrito povedano gre za hevristiko, ne za strukturni razčlenjevalnik: datoteke PDF ne vsebujejo zanesljivega semantičnega označevanja, temveč le vizualna navodila, kam naj gre črnilo, zato lahko oblikovalčeva nenavadna izbira pisave občasno zavede primerjavo velikosti, tabele pa so izrecno izključene – postavitev celic se na zanesljiv način ne da reducirati na naslove, sezname ali odstavke in to orodje se ne pretvarja, da je drugače. Vsaka stran je v izhodu jasno označena z ločilom »Stran N«, kar ustreza dogovoru, ki ga uporablja orodje za pretvorbo PDF v besedilo na tem spletnem mestu.

Skenirane strani so obravnavane enako odkrito kot drugod na tem spletnem mestu: stran, ki je v resnici le fotografija papirja, sploh nima tekstovne plasti, zato orodje, namesto da bi tiho ustvarilo prazen odsek, natančno zabeleži, katerih strani ni moglo prebrati, in za te strani usmeri na orodje Slika v besedilo (OCR). Vse se izvaja lokalno v vašem brskalniku – nič se ne nalaga, ni omejitev števila strani, rezultat pa se prikaže v besedilnem polju, ki ga lahko kopirate ali shranite kot datoteko .md, ki se odpre v katerem koli urejevalniku, ki podpira Markdown.