PDF til markdown-konverterer
Hent ut teksten fra en PDF som strukturert markdown: ekte overskriftsdeteksjon basert på skriftstørrelse, listedeteksjon fra kulepunkter og innrykk — ikke én stor vegg av tekst.
🔒 Behandles i sin helhet i nettleseren din – ingenting du skriver inn her blir noen gang lastet opp.
Resultat
En enkel «PDF til tekst»-dump gir deg alle ordene men ingen av formen: en sidetittel leses nøyaktig som en fotnote, og en punktliste blir en lang setning. Dette verktøyet går et skritt videre ved å lese hvert tekstelements reelle skriftstørrelse og posisjon fra PDF-en — via den samme pdf.js-motoren som nettstedets andre PDF-verktøy bruker — og bruker disse visuelle dataene til å rekonstruere struktur: overskrifter, listeelementer og avsnitt, skrevet ut som markdown.
Deteksjonen er virkelig målebasert, ikke en gjetning kamuflert som sådan. Tekstelementer på en side grupperes i linjer etter hvor nære hverandre de vertikale posisjonene deres er, hver linjes skriftstørrelse regnes ut fra dens egen tekstrenderingsmatrise, og den størrelsen sammenlignes mot median linjestørrelse for hele dokumentet — den størrelsen de fleste linjer faktisk bruker, dvs. vanlig brødtekst. En linje som er merkbart større enn den medianen blir en markdown-overskrift (de aller største linjene blir #, moderate større blir ##); en linje som starter med et kulepunkttegn eller står innrykket forbi de omkringliggende linjene blir et `- ` listeelement; alt annet behandles som brødtekst og slås sammen til avsnitt.
Dette er ærlig talt en heuristikk, ikke en strukturell parser: PDF-filer har ingen garantert semantisk markup, kun visuelle instrukser om hvor blekket skal, så en designers uvanlige skriftvalg kan av og til lure størrelsessammenligningen, og tabeller er uttrykkelig utenfor omfang — cellelayout reduserer seg ikke til overskrifter, lister eller avsnitt på noen pålitelig måte, og dette verktøyet later ikke som noe annet. Hver side merkes tydelig med en «Side N»-skillelinje i resultatet, i tråd med konvensjonen brukt av nettstedets PDF-til-tekst-verktøy.
Skannede sider får den samme ærlige behandlingen som ellers på dette nettstedet: en side som egentlig er et fotografi av papir har ikke noe tekstlag i det hele tatt, så i stedet for å produsere en tom seksjon i stillhet, noterer verktøyet nøyaktig hvilke sider det ikke kunne lese og henviser til bilde-til-tekst (OCR)-verktøyet for disse. Alt skjer lokalt i nettleseren din — ingenting lastes opp, det fins ingen sidegrenser, og resultatet havner i en tekstboks du kan kopiere eller lagre som en .md-fil som åpnes i ethvert redigeringsprogram med markdown-støtte.