0

Převodník PDF na Markdown

Extrahujte text z PDF jako strukturovaný Markdown: skutečné rozpoznávání nadpisů podle velikosti písma, detekce seznamů podle odrážek a odsazení – ne jen jednolitá hromada textu.

🔒 Zpracováno výhradně ve vašem prohlížeči – nic, co zde zadáte, se nikdy nenahraje.

📑

Přetáhněte sem PDF dokument

nebo klikněte pro výběr PDF souborů

Zpracovává se... 0%
Načítání PDF
Extrakce textu s pozicemi
Detekce nadpisů a struktury
Hotovo

Výsledek

Prostý „převod PDF na text“ vám dá všechna slova, ale bez jakékoli struktury: název stránky se čte stejně jako poznámka pod čarou a odrážkový seznam se slije do jedné věty. Tento nástroj jde o krok dál: u každého textového prvku přečte z PDF jeho skutečnou velikost písma a pozici – za pomoci engine pdf.js, který používají i další PDF nástroje na tomto webu – a na základě těchto vizuálních informací rekonstruuje strukturu: nadpisy, položky seznamů a odstavce, vše zapsané v Markdownu.

Detekce je skutečně založená na měření, nikoli na odhadu, který se za něj jen vydává. Textové prvky na stránce jsou seskupeny do řádků podle blízkosti jejich vertikálních pozic, pro každý řádek se vypočítá velikost písma z jeho vlastní transformační matice textu a tato velikost se porovná s mediánovou velikostí řádků v celém dokumentu – tedy velikostí, kterou má většina řádků, neboli běžný text. Řádek viditelně větší než tento medián se stane nadpisem v Markdownu (největší řádky jako #, středně velké jako ##); řádek začínající odrážkou nebo odsazený oproti okolním řádkům se stane položkou `- ` seznamu; vše ostatní je považováno za běžný text a slévá se do odstavců.

Upřímně řečeno, jde o heuristiku, nikoli o strukturální parser: soubory PDF neobsahují žádné garantované sémantické značky, pouze vizuální instrukce, kam umístit inkoust, takže neobvyklé fonty zvolené designérem mohou občas porovnávání velikostí zmást. Tabulky jsou záměrně mimo rozsah nástroje – rozvržení buněk nelze spolehlivě převést na nadpisy, seznamy nebo odstavce a tento nástroj to ani nepředstírá. Každá stránka je ve výstupu jasně označena oddělovačem „Stránka N“, jak je to obvyklé i u nástroje pro převod PDF na text na tomto webu.

Naskenované stránky jsou ošetřeny se stejnou poctivostí jako na celém tomto webu: stránka, která je ve skutečnosti jen fotografií papíru, nemá žádnou textovou vrstvu, takže místo toho, aby nástroj tiše vytvořil prázdnou sekci, přesně uvede, které stránky nemohl přečíst, a odkáže na nástroj Obrázek na text (OCR). Vše běží lokálně ve vašem prohlížeči – nic se neodesílá, žádná omezení počtu stránek a výsledek se zobrazí v textovém poli, odkud ho můžete zkopírovat nebo uložit jako soubor .md, který otevřete v libovolném editoru podporujícím Markdown.