0

PDF naar Markdown-converter

Extraheer de tekst van een PDF als gestructureerde Markdown: echte kopdetectie op basis van de lettergrootte, lijstdetectie op basis van opsommingstekens en inspringing - niet één platte tekstmuur.

📑

Sleep PDF-document hierheen

of klik om PDF-bestanden te zoeken

Buy Me a Coffee at ko-fi.com
Verwerken... 0%
PDF laden
Tekst extraheren met posities
Kopteksten en structuur detecteren
Klaar

Resultaat

Een gewone "PDF naar tekst"-dump geeft je elk woord zonder enige vorm: een paginatitel leest precies als een voetnoot, en een lijst met opsommingstekens verandert in een doorlopende zin. Deze tool gaat nog een stap verder door de werkelijke lettergrootte en positie van elk tekstitem uit de PDF te lezen (via dezelfde pdf.js-engine die de andere PDF-tools van deze site gebruiken) en dat visuele bewijsmateriaal te gebruiken om de structuur te reconstrueren: koppen, lijstitems en alinea's, uitgeschreven als Markdown.

De detectie is echt gebaseerd op metingen, en niet op een gok die als zodanig is verkleed. Tekstitems op een pagina worden in regels gegroepeerd op basis van hoe dicht hun verticale posities bij elkaar liggen. De lettergrootte van elke regel wordt berekend op basis van zijn eigen tekstweergavematrix, en die grootte wordt vergeleken met de gemiddelde lijngrootte voor het hele document - de grootte die de meeste regels feitelijk gebruiken, dat wil zeggen gewone hoofdtekst. Een lijn die merkbaar groter is dan de mediaan, wordt een Markdown-kop (de grootste lijnen worden #, redelijk grotere lijnen worden ##); een regel die begint met een opsommingsteken of ingesprongen is voorbij de omringende regels wordt een `- ` lijstitem; al het andere wordt behandeld als hoofdtekst en samengevoegd tot alinea's.

Dit is eerlijk gezegd een heuristische, geen structurele parser: PDF-bestanden bevatten geen gegarandeerde semantische opmaak, alleen visuele instructies voor waar de inkt naartoe gaat, dus de ongebruikelijke lettertypekeuzes van een ontwerper kunnen af en toe de groottevergelijking voor de gek houden, en tabellen vallen expliciet buiten het bereik - celindelingen worden op geen enkele betrouwbare manier gereduceerd tot koppen, lijsten of alinea's, en dit hulpmiddel pretendeert niet anders. Elke pagina is duidelijk gemarkeerd met een scheidingslijn "Pagina N" in de uitvoer, wat overeenkomt met de conventie die wordt gebruikt door de PDF-naar-tekst-tool van deze site.

Gescande pagina's krijgen dezelfde eerlijke behandeling als elders op deze site: een pagina die eigenlijk alleen maar een foto van papier is, heeft helemaal geen tekstlaag, dus in plaats van stilletjes een leeg gedeelte te produceren, noteert de tool precies welke pagina's hij niet kon lezen en verwijst daarvoor naar de tool Image to Text (OCR). Alles draait lokaal in uw browser: er wordt niets geüpload, er zijn geen paginalimieten en het resultaat komt terecht in een tekstvak dat u kunt kopiëren of opslaan als een .md-bestand dat wordt geopend in elke Markdown-bewuste editor.