PDF uz Markdown Converter
Izvelciet PDF tekstu kā strukturētu Markdown: reāla virsraksta noteikšana no fonta lieluma, saraksta noteikšana no aizzīmēm un atkāpēm — nevis viena plakana teksta siena.
Rezultāts
Vienkārša izdruka “PDF uz tekstu” sniedz jums katru vārdu bez formas: lapas virsraksts skan tieši tāpat kā zemsvītras piezīme, un saraksts ar aizzīmēm pārvēršas par izpildītu teikumu. Šis rīks iet vēl vienu soli tālāk, nolasot katra teksta vienuma reālo fonta lielumu un pozīciju no PDF — izmantojot to pašu pdf.js dzinēju, ko izmanto citi šīs vietnes PDF rīki, un izmantojot šos vizuālos pierādījumus, lai rekonstruētu struktūru: virsrakstus, saraksta vienumus un rindkopas, kas izrakstītas kā Markdown.
Atklāšana ir patiesi balstīta uz mērījumiem, nevis uz minējumiem, kas ietērpti kā viens. Lapas teksta vienumi tiek grupēti rindās pēc to vertikālo novietojumu tuvuma, katras rindiņas fonta lielums tiek aprēķināts no tās pašas teksta renderēšanas matricas, un šis lielums tiek salīdzināts ar visa dokumenta vidējo rindas lielumu — ar lielumu, ko faktiski izmanto lielākā daļa rindiņu, t.i., parastais pamatteksts. Līnija, kas ir ievērojami lielāka par šo vidējo, kļūst par Markdown virsrakstu (lielākās līnijas kļūst par #, vidēji lielākas par ##); rinda, kas sākas ar aizzīmju rakstzīmi vai atrodas ar atkāpi aiz apkārtējām rindām, kļūst par saraksta vienumu `-`; viss pārējais tiek uzskatīts par pamattekstu un apvienots rindkopās.
Šis ir heiristisks, nevis strukturāls parsētājs: PDF failiem nav garantēta semantiska marķējuma, ir tikai vizuāli norādījumi par to, kur tiek tinte, tāpēc dizainera neparastās fontu izvēles dažkārt var maldināt izmēru salīdzinājumu, un tabulas ir nepārprotami ārpus darbības jomas — šūnu izkārtojumi nekādā uzticamā veidā netiek samazināti līdz virsrakstiem, sarakstiem vai rindkopām, un šis rīks neizliekas citādi. Katra lapa izvadē ir skaidri atzīmēta ar atdalītāju "N lapa", kas atbilst šīs vietnes PDF pārveides rīka izmantotajam rīkam.
Skenētās lapas tiek apstrādātas tikpat godīgi kā citur šajā vietnē: lapai, kas patiesībā ir tikai papīra fotogrāfija, vispār nav teksta slāņa, tāpēc tā vietā, lai klusi izveidotu tukšu sadaļu, rīks precīzi norāda, kuras lapas nevarēja nolasīt, un norāda uz tām paredzēto rīku Image to Text (OCR). Viss darbojas lokāli jūsu pārlūkprogrammā — nekas netiek augšupielādēts, nav lapu ierobežojumu, un rezultāts nonāk tekstlodziņā, kuru varat kopēt vai saglabāt kā .md failu, kas tiek atvērts jebkurā Markdown zinošā redaktorā.