0

PDF-Markdown-muundur

Väljasta PDF-i tekst struktureeritud Markdownina: pealkirjad tuvastatakse fondisuuruse järgi, loendid tuvastatakse täppide ja taande järgi – mitte ühtlane tekstiplokk.

🔒 Töödeldud täielikult teie brauseris – midagi, mida siia sisestate, ei laadita kunagi üles.

📑

Lohista PDF-dokument siia

või klõpsa PDF-failide sirvimiseks

Töötlen... 0%
PDF-i laadimine
Teksti väljavõtmine koos positsioonidega
Pealkirjade ja struktuuri tuvastamine
Valmis

Tulemus

Tavaline „PDF tekstiks” tõlge annab sulle kõik sõnad, kuid ilma igasuguse struktuurita: lehekülje pealkiri loeb nagu allmärkus ja täpploend muutub üheks jooksvaks lauseks. See tööriist läheb sammu edasi, lugedes igast tekstielemendist PDF-is selle tegeliku fondisuuruse ja asukoha – kasutades sama pdf.js mootorit, mida selle saidi teised PDF-tööriistad – ning kasutab seda visuaalset tõendusmaterjali struktuuri taastamiseks: pealkirjad, loendiüksused ja lõigud, mis kirjutatakse välja Markdownina.

Tuvastus põhineb tõepoolest mõõtmistel, mitte oletusel, mis on oletuseks maskeeritud. Tekstielemendid lehel rühmitatakse ridadeks nende vertikaalsete positsioonide läheduse alusel, iga rea fondisuurus arvutatakse selle teksti renderdusmaatriksi põhjal ning seda suurust võrreldakse kogu dokumendi mediaanse reasuurusega – suurusega, mida enamik ridu tegelikult kasutab, s.t tavalise põhitekstiga. Sellest mediaanist märgatavalt suurem rida muutub Markdowni pealkirjaks (kõige suurematest ridadest saab #, mõõdukalt suurematest ##); rida, mis algab täpploendi märgiga või on ümbritsevatest ridadest taandatud, muutub `- ` loendiüksuseks; kõike muud käsitletakse põhitekstina ja ühendatakse lõikudeks.

See on ausalt öeldes heuristika, mitte struktuurianalüsaator: PDF-failid ei sisalda garanteeritud semantilist märgendust, vaid ainult visuaalseid juhiseid selle kohta, kuhu tinti panna, seega võib kujundaja ebatavaline fondivalik vahel suuruse võrdlust eksitada, ning tabelid on otsesõnu välistatud – lahtrite paigutust ei saa usaldusväärselt taandada pealkirjadeks, loenditeks ega lõikudeks ja see tööriist ei teesegi vastupidist. Iga lehekülg on väljundis selgelt tähistatud eraldusmärgiga „Lehekülg N”, järgides selle saidi PDF-tekstiks-tööriista tava.

Skaneeritud lehti koheldakse sama ausalt nagu mujal sellel saidil: leht, mis on tegelikult vaid paberist foto, ei sisalda üldse tekstikihti, nii et tühja lõigu vaikimisi loomise asemel märgib tööriist täpselt, milliseid lehti ei suudetud lugeda, ja juhatab nende jaoks Pilt tekstiks (OCR) tööriista juurde. Kõik töötab lokaalselt sinu brauseris – midagi ei laadita üles, leheküljepiiranguid pole ja tulemus ilmub tekstikasti, mida saad kopeerida või salvestada .md-failina, mis avaneb igas Markdowni toetavas redaktoris.