0

PDF Markdown Converter

Pura PDF-teksti jäsenneltynä Markdown: todellinen otsikon tunnistus kirjasinkoosta, luettelon tunnistus luettelomerkeistä ja sisennyksistä – ei yksi litteä tekstiseinä.

📑

Vedä ja pudota PDF-dokumentti tähän

tai Napsauta selataksesi PDF-tiedostoja

Buy Me a Coffee at ko-fi.com
Käsitellään... 0%
Ladataan PDF
Tekstin purkaminen paikoilla
Otsikon ja rakenteen tunnistaminen
Valmis

Tulos

Pelkkä PDF tekstiksi -vedos antaa sinulle jokaisen sanan ilman muotoa: sivun otsikko on täsmälleen kuten alaviite, ja luettelomerkitty luettelo muuttuu suoritetuksi lauseeksi. Tämä työkalu menee askeleen pidemmälle lukemalla jokaisen tekstikohteen todellisen kirjasinkoon ja sijainnin PDF-tiedostosta – saman pdf.js-moottorin kautta, jota tämän sivuston muut PDF-työkalut käyttävät – ja käyttämällä tätä visuaalista näyttöä rakenteen rekonstruoimiseen: otsikot, luettelokohteet ja kappaleet, kirjoitettuna Markdown-muodossa.

Havainto perustuu aidosti mittauksiin, ei arvaukseen pukeutuneena. Sivun tekstikohteet on ryhmitelty riveihin sen mukaan, kuinka lähellä niiden pystysuorat paikat ovat, kunkin rivin kirjasinkoko lasketaan sen omasta tekstintoistomatriisista, ja tätä kokoa verrataan koko asiakirjan rivin mediaanikokoon – kokoon, jota useimmat rivit todella käyttävät, eli tavallista leipätekstiä. Tätä mediaania huomattavasti suuremmasta rivistä tulee Markdown-otsikko (suurimmista riveistä tulee #, kohtalaisen suuremmista ##); rivistä, joka alkaa luettelomerkillä tai joka on sisennettynä ympäröivien rivien ohi, tulee `- ` -luettelokohde; kaikkea muuta käsitellään leipätekstinä ja yhdistetään kappaleiksi.

Tämä on rehellisesti sanottuna heuristinen, ei rakenteellinen jäsentäjä: PDF-tiedostoissa ei ole taattua semanttista merkintää, vain visuaaliset ohjeet siitä, mihin muste menee, joten suunnittelijan epätavalliset kirjasinvalinnat voivat toisinaan hämätä kokovertailua, ja taulukot ovat nimenomaisesti soveltamisalan ulkopuolella – soluasettelut eivät rajoitu otsikoiksi, luetteloiksi tai kappaleiksi millään luotettavalla tavalla, eikä tämä työkalu teeskentele toisin. Jokainen sivu on selvästi merkitty tulosteen "Sivu N" -jakajalla, mikä vastaa tämän sivuston PDF-tekstityökalun käyttämää käytäntöä.

Skannatut sivut saavat saman rehellisen kohtelun kuin muualla tällä sivustolla: sivulla, joka on oikeastaan vain valokuva paperista, ei ole lainkaan tekstikerrosta, joten sen sijaan, että se tuottaisi äänettömästi tyhjän osan, työkalu merkitsee tarkalleen, mitä sivuja se ei pystynyt lukemaan, ja osoittaa niille tarkoitettuun Image to Text (OCR) -työkaluun. Kaikki toimii paikallisesti selaimessasi – mitään ei ladata, sivuille ei ole rajoituksia, ja tulos päätyy tekstiruutuun, jonka voit kopioida tai tallentaa .md-tiedostona, joka avautuu missä tahansa Markdown-aware-editorissa.