PDF til Markdown Converter
Udpak en PDF-tekst som struktureret Markdown: reel overskriftsdetektion fra skriftstørrelse, listegenkendelse fra punkttegn og indrykning - ikke en flad tekstvæg.
Resultat
Et almindeligt "PDF til tekst"-dump giver dig hvert ord uden form: en sidetitel læses nøjagtigt som en fodnote, og en punktopstilling bliver til en tilløbssætning. Dette værktøj går et skridt videre ved at læse hvert tekstelements reelle skriftstørrelse og position fra PDF'en - via den samme pdf.js-motor, som denne sides andre PDF-værktøjer bruger - og bruge det visuelle bevis til at rekonstruere strukturen: overskrifter, listeelementer og afsnit, skrevet ud som Markdown.
Detektionen er ægte målingsbaseret, ikke et gæt udklædt som et. Tekstelementer på en side er grupperet i linjer efter, hvor tæt deres lodrette positioner er, hver linjes skriftstørrelse beregnes ud fra sin egen tekstgengivelsesmatrix, og denne størrelse sammenlignes med medianlinjestørrelsen for hele dokumentet - den størrelse de fleste linjer faktisk bruger, dvs. almindelig brødtekst. En linje mærkbart større end denne median bliver en Markdown-overskrift (de største linjer bliver #, moderat større bliver ##); en linje, der starter med et punkttegn eller sidder indrykket forbi de omgivende linjer, bliver et `-` listeelement; alt andet behandles som brødtekst og slås sammen til afsnit.
Dette er ærligt talt en heuristik, ikke en strukturel parser: PDF-filer har ingen garanteret semantisk markering, kun visuelle instruktioner for, hvor blækket går, så en designers usædvanlige skrifttypevalg kan lejlighedsvis narre størrelsessammenligningen, og tabeller er eksplicit uden for rækkevidde - cellelayout reduceres ikke til overskrifter, lister eller afsnit på nogen måde, som ikke er pålidelige, og på nogen anden måde gør dette værktøj ikke pålideligt. Hver side er tydeligt markeret med en "Side N"-deler i outputtet, der matcher konventionen, der bruges af dette websteds PDF-til-tekst-værktøj.
Scannede sider får den samme ærlige behandling som andre steder på dette websted: en side, der i virkeligheden kun er et fotografi af papir, har slet ikke noget tekstlag, så i stedet for lydløst at producere en tom sektion, noterer værktøjet præcis, hvilke sider det ikke kunne læse og peger på værktøjet Image to Text (OCR) for dem. Alt kører lokalt i din browser - intet uploades, der er ingen sidebegrænsninger, og resultatet lander i en tekstboks, du kan kopiere eller gemme som en .md-fil, der åbnes i enhver Markdown-bevidst editor.