PDF til Markdown-konverter
Uddrag teksten fra en PDF som struktureret Markdown: ægte overskriftsgenkendelse ud fra skriftstørrelse, listegenkendelse ud fra punktopstilling og indrykning – ikke bare én lang, flad væg af tekst.
🔒 Behandles helt i din browser - intet, du indtaster her, bliver nogensinde uploadet.
Resultat
En simpel “PDF til tekst”-konvertering giver dig alle ordene, men intet af formen: en sidetitel læses nøjagtig som en fodnote, og en punktopstillet liste bliver til én lang sætning. Dette værktøj går et skridt videre ved at aflæse den reelle skriftstørrelse og position for hvert tekstelement fra PDF’en – via den samme pdf.js-motor, som bruges af dette websites andre PDF-værktøjer – og bruge den visuelle evidens til at genskabe strukturen: overskrifter, listeelementer og afsnit, skrevet ud som Markdown.
Genkendelsen er ægte målingsbaseret, ikke et gæt, der er forklædt som et. Tekstelementer på en side grupperes i linjer ud fra, hvor tæt de ligger lodret på hinanden; hver linjes skriftstørrelse beregnes ud fra dens egen tekstgengivelsesmatrix, og denne størrelse sammenlignes med medianlinjestørrelsen for hele dokumentet – den størrelse, de fleste linjer faktisk bruger, dvs. almindelig brødtekst. En linje, der er mærkbart større end den median, bliver til en Markdown-overskrift (de allerstørste linjer bliver til #, moderat større linjer bliver til ##); en linje, der starter med et punktopstillingstegn, eller som er indrykket i forhold til de omgivende linjer, bliver til et `- `-listeelement; alt andet behandles som brødtekst og sammensmeltes til afsnit.
Dette er ærligt talt en heuristik, ikke en strukturel parser: PDF-filer indeholder ikke nogen garanteret semantisk opmærkning, kun visuelle instruktioner om, hvor blækket skal placeres, så en designers usædvanlige skriftvalg kan af og til narre størrelsessammenligningen, og tabeller er udtrykkeligt uden for dette værktøjs anvendelsesområde – cellelayouts kan ikke på nogen pålidelig måde reduceres til overskrifter, lister eller afsnit, og dette værktøj lader ikke som om det kan. Hver side er tydeligt markeret med en “Side N”-skillelinje i resultatet, i overensstemmelse med den konvention, der bruges af dette websites PDF-til-tekst-værktøj.
Indscannede sider får den samme ærlige behandling som andre steder på dette website: En side, der i virkeligheden blot er et fotografi af et stykke papir, har slet intet tekstlag, så i stedet for i stilhed at producere et tomt afsnit angiver værktøjet præcist, hvilke sider det ikke kunne læse, og henviser til Billede til tekst (OCR)-værktøjet for disse sider. Alt kører lokalt i din browser – intet uploades, der er ingen sidebegrænsninger, og resultatet havner i et tekstfelt, du kan kopiere eller gemme som en .md-fil, der åbnes i enhver Markdown-kompatibel editor.