PDF naar Markdown-converter
Extraheer de tekst van een PDF als gestructureerde Markdown: echte kopdetectie op basis van lettergrootte, lijstdetectie op basis van bullets en inspringing — niet één platte lap tekst.
🔒 Wordt volledig in uw browser verwerkt. Niets wat u hier invoert, wordt ooit geüpload.
Resultaat
Een eenvoudige "PDF naar tekst"-dump geeft je elk woord maar zonder enige vorm: een paginatitel leest net als een voetnoot, en een lijst met bullets wordt een doorgelopen zin. Deze tool gaat een stap verder door de echte lettergrootte en positie van elk tekstitem uit de PDF te lezen — via dezelfde pdf.js-engine die de andere PDF-tools van deze site gebruiken — en dat visuele bewijs te gebruiken om structuur te reconstrueren: koppen, lijstitems en alinea's, uitgeschreven als Markdown.
De detectie is echt meetgebaseerd, niet een verpakte gissing. Tekstitems op een pagina worden gegroepeerd in regels op basis van hoe dicht hun verticale posities bij elkaar liggen, de lettergrootte van elke regel wordt berekend uit zijn eigen tekstrendermatrix, en die grootte wordt vergeleken met de mediane regelgrootte van het hele document — de grootte die de meeste regels daadwerkelijk gebruiken, oftewel gewone broodtekst. Een regel die merkbaar groter is dan die mediaan wordt een Markdown-kop (de grootste regels worden #, redelijk grotere worden ##); een regel die begint met een bulletteken of verder is ingesprongen dan de omringende regels wordt een `- ` lijstitem; al het andere wordt behandeld als broodtekst en samengevoegd tot alinea's.
Dit is eerlijk gezegd een heuristiek, geen structurele parser: PDF-bestanden bevatten geen gegarandeerde semantische opmaak, alleen visuele instructies voor waar inkt moet komen, dus ongebruikelijke lettertypekeuzes van een ontwerper kunnen de groottevergelijking af en toe foppen, en tabellen vallen uitdrukkelijk buiten de scope — celindelingen zijn op geen betrouwbare manier te reduceren tot koppen, lijsten of alinea's, en deze tool doet niet alsof dat anders is. Elke pagina wordt in de uitvoer duidelijk gemarkeerd met een "Pagina N"-scheiding, volgens de conventie die door de PDF-naar-tekst-tool van deze site wordt gebruikt.
Gescande pagina's krijgen dezelfde eerlijke behandeling als elders op deze site: een pagina die eigenlijk alleen een foto van papier is, heeft helemaal geen tekstlaag, dus in plaats van stilletjes een lege sectie te produceren, noteert de tool precies welke pagina's hij niet kon lezen en verwijst hij voor die pagina's naar de Afbeelding naar Tekst (OCR)-tool. Alles draait lokaal in je browser — er wordt niets geüpload, er zijn geen paginalimieten, en het resultaat komt in een tekstvak dat je kunt kopiëren of opslaan als .md-bestand dat in elke Markdown-bewuste editor te openen is.