PDF zu Markdown Konverter
Extrahieren Sie den Text einer PDF als strukturiertes Markdown: echte Überschriftenerkennung anhand der Schriftgröße, Listenerkennung anhand von Aufzählungszeichen und Einrückungen – keine einzige unstrukturierte Textwand.
🔒 Wird vollständig in Ihrem Browser verarbeitet – nichts, was Sie hier eingeben, wird jemals hochgeladen.
Ergebnis
Eine bloße „PDF zu Text“-Ausgabe liefert alle Wörter ohne jegliche Struktur: Ein Seitentitel liest sich dann wie eine Fußnote, und eine Aufzählung wird zum Bandwurmsatz. Dieses Werkzeug geht einen Schritt weiter, indem es die tatsächliche Schriftgröße und Position jedes Textelements aus der PDF ausliest – mit derselben pdf.js-Engine, die auch die anderen PDF-Werkzeuge dieser Website nutzen – und aus diesen visuellen Hinweisen die Struktur rekonstruiert: Überschriften, Listenelemente und Absätze, ausgegeben als Markdown.
Die Erkennung basiert tatsächlich auf Messwerten und ist keine bloß vorgetäuschte Schätzung. Die Textelemente einer Seite werden anhand ihrer vertikalen Abstände zu Zeilen gruppiert, die Schriftgröße jeder Zeile wird aus ihrer eigenen Text-Rendering-Matrix berechnet, und diese Größe wird mit der medianen Zeilengröße des gesamten Dokuments verglichen – der Größe, die die meisten Zeilen tatsächlich verwenden, also gewöhnlicher Fließtext. Eine Zeile, die deutlich größer als dieser Median ist, wird zu einer Markdown-Überschrift (die größten Zeilen werden zu #, mäßig größere zu ##); eine Zeile, die mit einem Aufzählungszeichen beginnt oder stärker eingerückt ist als die umgebenden Zeilen, wird zu einem `- `-Listenelement; alles Übrige wird als Fließtext behandelt und zu Absätzen zusammengeführt.
Dies ist ehrlicherweise eine Heuristik, kein struktureller Parser: PDF-Dateien enthalten keine garantiert semantische Auszeichnung, sondern lediglich visuelle Anweisungen, wohin die Tinte gesetzt wird. Ungewöhnliche Schriftentscheidungen eines Designers können daher gelegentlich den Größenvergleich irritieren, und Tabellen liegen explizit außerhalb des Anwendungsbereichs – Zellenlayouts lassen sich nicht zuverlässig auf Überschriften, Listen oder Absätze reduzieren, und dieses Werkzeug gibt auch nicht vor, dies zu tun. Jede Seite wird in der Ausgabe deutlich mit einem „Seite N“-Trenner markiert, gemäß der Konvention, die auch das PDF-zu-Text-Werkzeug dieser Website verwendet.
Gescannte Seiten werden genauso ehrlich behandelt wie an anderer Stelle auf dieser Website: Eine Seite, die in Wirklichkeit nur ein Foto des Papiers ist, besitzt überhaupt keine Textebene. Anstatt stillschweigend einen leeren Abschnitt zu erzeugen, vermerkt das Werkzeug daher genau, welche Seiten es nicht lesen konnte, und verweist für diese auf das Bild-zu-Text-Werkzeug (OCR). Alles läuft lokal in Ihrem Browser – nichts wird hochgeladen, es gibt keine Seitenbegrenzung, und das Ergebnis landet in einem Textfeld, das Sie kopieren oder als .md-Datei speichern können, die sich in jedem Markdown-fähigen Editor öffnen lässt.