PDF-zu-Markdown-Konverter
Extrahieren Sie den Text einer PDF-Datei als strukturierten Markdown: echte Überschriftenerkennung anhand der Schriftgröße, Listenerkennung anhand von Aufzählungszeichen und Einzügen – nicht eine flache Textwand.
Ergebnis
Bei einem einfachen „PDF-to-Text“-Dump erhalten Sie jedes Wort ohne jegliche Form: Ein Seitentitel liest sich genau wie eine Fußnote, und eine Liste mit Aufzählungszeichen wird zu einem Folgesatz. Dieses Tool geht noch einen Schritt weiter, indem es die tatsächliche Schriftgröße und -position jedes Textelements aus dem PDF liest – über dieselbe pdf.js-Engine, die auch die anderen PDF-Tools dieser Website verwenden – und diese visuellen Beweise verwendet, um die Struktur zu rekonstruieren: Überschriften, Listenelemente und Absätze, geschrieben als Markdown.
Die Erkennung basiert tatsächlich auf Messungen und nicht auf einer als solche getarnten Vermutung. Textelemente auf einer Seite werden nach der Nähe ihrer vertikalen Positionen in Zeilen gruppiert, die Schriftgröße jeder Zeile wird anhand ihrer eigenen Textwiedergabematrix berechnet und diese Größe wird mit der mittleren Zeilengröße für das gesamte Dokument verglichen – der Größe, die die meisten Zeilen tatsächlich verwenden, d. h. normaler Fließtext. Eine Zeile, die deutlich größer als dieser Median ist, wird zu einer Markdown-Überschrift (die größten Zeilen werden zu #, mäßig größere zu ##); Eine Zeile, die mit einem Aufzählungszeichen beginnt oder über die umgebenden Zeilen hinaus eingerückt ist, wird zu einem „-“-Listenelement. alles andere wird als Fließtext behandelt und in Absätze zusammengefasst.
Dabei handelt es sich ehrlich gesagt um eine Heuristik und nicht um einen strukturellen Parser: PDF-Dateien verfügen über kein garantiertes semantisches Markup, sondern nur über visuelle Anweisungen, wohin die Tinte gelangt. Daher können ungewöhnliche Schriftartenwahlen eines Designers gelegentlich den Größenvergleich verfälschen, und Tabellen liegen ausdrücklich außerhalb des Gültigkeitsbereichs – Zellenlayouts lassen sich nicht auf zuverlässige Weise auf Überschriften, Listen oder Absätze reduzieren, und dieses Tool gibt nicht vor, etwas anderes zu sagen. Jede Seite ist in der Ausgabe deutlich mit einer „Seite N“-Trennlinie gekennzeichnet, die der Konvention entspricht, die vom PDF-zu-Text-Tool dieser Website verwendet wird.
Gescannte Seiten werden genauso ehrlich behandelt wie anderswo auf dieser Website: Eine Seite, die eigentlich nur ein Papierfoto ist, hat überhaupt keine Textebene. Anstatt also stillschweigend einen leeren Abschnitt zu erzeugen, notiert das Tool genau, welche Seiten es nicht lesen konnte, und verweist für diese auf das Image to Text (OCR)-Tool. Alles läuft lokal in Ihrem Browser – nichts wird hochgeladen, es gibt keine Seitenbegrenzungen und das Ergebnis landet in einem Textfeld, das Sie kopieren oder als .md-Datei speichern können, die in jedem Markdown-fähigen Editor geöffnet wird.