PDF til Markdown Converter
Trekk ut en PDF-tekst som strukturert Markdown: ekte overskriftsgjenkjenning fra skriftstørrelse, listegjenkjenning fra punkttegn og innrykk – ikke én flat vegg med tekst.
Resultat
En vanlig "PDF til tekst"-dump gir deg hvert ord uten noen form: en sidetittel leses nøyaktig som en fotnote, og en punktliste blir til en løpende setning. Dette verktøyet går ett skritt videre ved å lese hvert tekstelements virkelige skriftstørrelse og plassering fra PDF-en – via den samme pdf.js-motoren som dette nettstedets andre PDF-verktøy bruker – og bruke det visuelle beviset til å rekonstruere strukturen: overskrifter, listeelementer og avsnitt, skrevet ut som Markdown.
Deteksjonen er genuint målingsbasert, ikke en gjetning kledd ut som en. Tekstelementer på en side er gruppert i linjer etter hvor nær de vertikale posisjonene deres er, hver linjes skriftstørrelse beregnes fra sin egen tekstgjengivelsesmatrise, og den størrelsen sammenlignes med medianlinjestørrelsen for hele dokumentet - størrelsen de fleste linjer faktisk bruker, dvs. vanlig brødtekst. En linje som er merkbart større enn denne medianen blir en Markdown-overskrift (de største linjene blir #, moderat større blir ##); en linje som starter med et punkttegn eller sitter innrykket forbi linjene rundt blir et `- ` listeelement; alt annet blir behandlet som brødtekst og slått sammen til avsnitt.
Dette er ærlig talt en heuristikk, ikke en strukturell parser: PDF-filer har ingen garantert semantisk markering, bare visuelle instruksjoner for hvor blekket går, så en designers uvanlige skriftvalg kan av og til lure størrelsessammenligningen, og tabeller er eksplisitt utenfor omfanget – celleoppsett reduseres ikke til overskrifter, lister eller avsnitt på noen måte som ikke er pålitelig, og på noen annen måte. Hver side er tydelig merket med en "Side N"-deler i utdataene, som samsvarer med konvensjonen som brukes av dette nettstedets PDF-til-tekst-verktøy.
Skannede sider får den samme ærlige behandlingen som andre steder på denne siden: en side som egentlig bare er et fotografi av papir har ikke noe tekstlag i det hele tatt, så i stedet for å produsere en tom del i det stille, noterer verktøyet nøyaktig hvilke sider det ikke kunne lese og peker til bilde til tekst-verktøyet (OCR) for disse. Alt kjører lokalt i nettleseren din – ingenting lastes opp, det er ingen sidegrenser, og resultatet lander i en tekstboks du kan kopiere eller lagre som en .md-fil som åpnes i et hvilket som helst Markdown-bevisst redigeringsprogram.