Konvertor PDF do Markdown
Extrahujte text PDF ako štruktúrovaný Markdown: skutočná detekcia nadpisov podľa veľkosti písma, detekcia zoznamu podľa odrážok a odsadenia – nie jedna plochá stena textu.
Výsledok
Jednoduchý výpis „PDF do textu“ vám poskytne každé slovo bez akéhokoľvek tvaru: názov stránky sa číta presne ako poznámka pod čiarou a zoznam s odrážkami sa zmení na bežnú vetu. Tento nástroj ide ešte o krok ďalej tým, že prečíta skutočnú veľkosť a polohu písma každej textovej položky z PDF – prostredníctvom rovnakého nástroja pdf.js, ktorý používajú ostatné nástroje PDF na tejto stránke – a pomocou tohto vizuálneho dôkazu zrekonštruuje štruktúru: nadpisy, položky zoznamu a odseky napísané ako Markdown.
Detekcia je skutočne založená na meraní, nie na hádankách, ktoré sú zaškatuľkované. Textové položky na stránke sú zoskupené do riadkov podľa toho, ako blízko sú ich vertikálne polohy, veľkosť písma každého riadka sa vypočíta z jeho vlastnej matice vykresľovania textu a táto veľkosť sa porovnáva so strednou veľkosťou riadku pre celý dokument – veľkosť, ktorú skutočne používa väčšina riadkov, t. j. obyčajný hlavný text. Riadok výrazne väčší ako tento medián sa stane nadpisom Markdown (najväčšie riadky sa stanú #, stredne väčšie sa stanú ##); riadok, ktorý začína znakom odrážky alebo je odsadený za okolitými riadkami, sa stáva položkou zoznamu `- `; všetko ostatné sa považuje za hlavný text a zlúči sa do odsekov.
Toto je úprimne heuristika, nie štrukturálny analyzátor: súbory PDF neobsahujú žiadne zaručené sémantické označenie, iba vizuálne pokyny, kde ide atrament, takže nezvyčajné výbery písma dizajnéra môžu občas oklamať porovnanie veľkosti a tabuľky sú vyslovene mimo rozsah – rozloženia buniek sa žiadnym spoľahlivým spôsobom neredukujú na nadpisy, zoznamy alebo odseky a tento nástroj nepredstiera opak. Každá strana je na výstupe zreteľne označená oddeľovačom „Stránka N“, ktorý zodpovedá konvencii používanej nástrojom PDF na text tejto stránky.
S naskenovanými stránkami sa zaobchádza rovnako poctivo ako inde na tejto lokalite: stránka, ktorá je v skutočnosti len fotografiou papiera, nemá vôbec žiadnu textovú vrstvu, takže namiesto tichého vytvárania prázdnej sekcie nástroj presne zaznamená, ktoré stránky sa nepodarilo prečítať, a pre ne ukáže na nástroj Obrázok na text (OCR). Všetko beží lokálne vo vašom prehliadači – nič sa neodovzdáva, neexistujú žiadne obmedzenia stránok a výsledok sa zobrazí v textovom poli, ktoré môžete skopírovať alebo uložiť ako súbor .md, ktorý sa otvorí v akomkoľvek editore s podporou Markdown.