PDF Markdown-muuntimeksi
Poimi PDF:n teksti jäsenneltynä Markdownina: aito otsikoiden tunnistus fonttikoon perusteella, listojen tunnistus luettelomerkeistä ja sisennyksistä – ei vain yhtä muodotonta tekstimassaa.
🔒 Käsitelty kokonaan selaimessasi – mitään tähän kirjoittamaasi ei koskaan ladata.
Tulos
Pelkkä "PDF tekstiksi" -kaatolataus antaa sinulle kaikki sanat, mutta ei minkäänlaista muotoa: sivun otsikko näyttää samalta kuin alaviite, ja luettelomerkein varustetusta listasta tulee yhteen pötköön kirjoitettu virke. Tämä työkalu menee askeleen pidemmälle lukemalla jokaisen tekstielementin todellisen fonttikoon ja sijainnin PDF:stä – käyttäen samaa pdf.js-moottoria kuin tämän sivuston muut PDF-työkalut – ja käyttää tätä visuaalista näyttöä rakenteen uudelleenmuodostamiseen: otsikot, listaelementit ja kappaleet kirjoitetaan ulos Markdownina.
Tunnistus perustuu aitoihin mittauksiin, ei pelkkään arvaukseen. Sivun tekstielementit ryhmitellään riveiksi pystysuuntaisen etäisyyden perusteella, jokaisen rivin fonttikoko lasketaan sen omasta tekstinmuodostusmatriisista, ja tätä kokoa verrataan koko dokumentin rivien mediaanikokoon – siihen kokoon, jota useimmat rivit käyttävät, eli tavalliseen leipätekstiin. Rivi, joka on selvästi tätä mediaania suurempi, muuttuu Markdown-otsikoksi (suurimmat rivit muuttuvat #-merkinnöiksi, hieman suuremmat ##-merkinnöiksi); rivi, joka alkaa luettelomerkillä tai on sisennetty ympäröiviä rivejä enemmän, muuttuu `- `-alkuiseksi listaelementiksi; kaikkea muuta käsitellään leipätekstinä ja yhdistetään kappaleiksi.
Tämä on rehellisesti sanottuna heuristiikka, ei rakenteellinen jäsennin: PDF-tiedostot eivät sisällä taattua semanttista merkintää, ainoastaan visuaalisia ohjeita siitä, mihin mustetta laitetaan, joten suunnittelijan epätavalliset fonttivalinnat voivat toisinaan hämätä kokoon perustuvaa vertailua, ja taulukot on nimenomaisesti rajattu ulkopuolelle – soluasettelut eivät pelkisty otsikoiksi, listoiksi tai kappaleiksi millään luotettavalla tavalla, eikä tämä työkalu esitä muuta. Jokainen sivu on selvästi merkitty tulosteeseen ”Sivu N” -väliotsikolla, mikä vastaa tämän sivuston PDF tekstiksi -työkalun käytäntöä.
Skannatut sivut saavat saman rehellisen käsittelyn kuin muuallakin tällä sivustolla: sivu, joka on pelkkä valokuva paperista, ei sisällä lainkaan tekstikerrosta, joten sen sijaan, että työkalu tuottaisi hiljaisesti tyhjän osion, se merkitsee tarkasti, mitä sivuja se ei voinut lukea, ja ohjaa ne Kuva tekstiksi -työkaluun (OCR). Kaikki tapahtuu paikallisesti selaimessasi – mitään ei lähetetä, sivumäärää ei ole rajoitettu, ja lopputulos päätyy tekstikenttään, jonka voit kopioida tai tallentaa .md-tiedostona, joka avautuu missä tahansa Markdownia tukevassa editorissa.