0

Převaděč PDF do Markdown

Extrahujte text PDF jako strukturovaný Markdown: skutečná detekce nadpisu z velikosti písma, detekce seznamu z odrážek a odsazení – žádná plochá stěna textu.

📑

Sem přetáhněte dokument PDF

nebo kliknutím procházejte soubory PDF

Buy Me a Coffee at ko-fi.com
Zpracování... 0%
Načítání PDF
Extrahování textu s pozicemi
Detekce nadpisů a struktury
Hotovo

Výsledek

Prostý výpis „PDF do textu“ vám poskytne každé slovo bez tvaru: název stránky se čte přesně jako poznámka pod čarou a seznam s odrážkami se změní v běžnou větu. Tento nástroj jde ještě o krok dále tím, že načte skutečnou velikost a polohu písma každé textové položky z PDF – prostřednictvím stejného pdf.js motoru, který používají ostatní nástroje PDF tohoto webu – a pomocí těchto vizuálních důkazů rekonstruuje strukturu: nadpisy, položky seznamu a odstavce, napsané jako Markdown.

Detekce je skutečně založena na měření, nikoli na odhadech převlečených za jeden. Textové položky na stránce jsou seskupeny do řádků podle toho, jak blízko jsou jejich vertikální polohy, velikost písma každého řádku se vypočítá z jeho vlastní matice vykreslování textu a tato velikost se porovná se střední velikostí řádku pro celý dokument – ​​velikost, kterou skutečně používá většina řádků, tedy běžný hlavní text. Řádek znatelně větší než tento medián se stane nadpisem Markdown (největší řádky se stanou #, středně větší ##); řádek, který začíná znakem odrážky nebo je odsazený za okolními řádky, se stane položkou seznamu `- `; vše ostatní je považováno za hlavní text a sloučeno do odstavců.

Toto je upřímně heuristika, nikoli strukturální analyzátor: soubory PDF nenesou žádné zaručené sémantické označení, pouze vizuální pokyny pro to, kam jde inkoust, takže neobvyklé volby písma designéra mohou občas oklamat srovnání velikosti a tabulky jsou výslovně mimo rozsah – rozložení buněk se žádným spolehlivým způsobem neredukuje na nadpisy, seznamy nebo odstavce a tento nástroj nepředstírá opak. Každá stránka je na výstupu jasně označena oddělovačem „Stránka N“, což odpovídá konvenci používané nástrojem PDF-to-text tohoto webu.

S naskenovanými stránkami se zachází stejně poctivě jako jinde na tomto webu: stránka, která je ve skutečnosti jen fotografií papíru, nemá vůbec žádnou textovou vrstvu, takže místo toho, aby potichu vytvořil prázdnou sekci, nástroj přesně zaznamená, které stránky nemohl přečíst, a pro ty ukáže na nástroj Image to Text (OCR). Vše běží lokálně ve vašem prohlížeči – nic se nenahrává, neexistují žádná omezení stránek a výsledek se zobrazí v textovém poli, které můžete zkopírovat nebo uložit jako soubor .md, který se otevře v libovolném editoru podporujícím Markdown.