0

PDF uz Markdown konvertētājs

Iegūstiet PDF tekstu strukturētā Markdown formātā: reāla virsrakstu noteikšana pēc fonta izmēra, sarakstu noteikšana pēc aizzīmēm un atkāpēm — nevis vienkārša teksta siena.

🔒 Pilnībā apstrādāts jūsu pārlūkprogrammā — nekas, ko jūs šeit ievadāt, nekad netiek augšupielādēts.

📑

Velciet un nometiet PDF dokumentu šeit

vai Noklikšķiniet, lai pārlūkotu PDF failus

Apstrādā... 0%
Ielādē PDF
Iegūst tekstu ar pozīcijām
Nosaka virsrakstus un struktūru
Gatavs

Rezultāts

Vienkāršs “PDF uz tekstu” izvadījums dod visus vārdus, bet nekādu struktūru: lappuses virsraksts izskatās tāpat kā zemsvītras piezīme, un aizzīmju saraksts pārvēršas par nepārtrauktu teikumu. Šis rīks sper soli tālāk, nolasot katra teksta elementa reālo fonta izmēru un pozīciju no PDF — izmantojot to pašu pdf.js programmu, ko izmanto citi šīs vietnes PDF rīki — un izmantojot šos vizuālos pierādījumus, lai rekonstruētu struktūru: virsrakstus, saraksta elementus un paragrāfus, pierakstītus Markdown formātā.

Noteikšana patiešām balstās uz mērījumiem, nevis uz minējumu, kas izlikts par mērījumu. Teksta elementi lappusē tiek grupēti rindiņās pēc to vertikālo pozīciju tuvuma, katras rindiņas fonta izmērs tiek aprēķināts no tās pašas teksta renderēšanas matricas, un šis izmērs tiek salīdzināts ar visa dokumenta vidējo rindiņas izmēru — izmēru, kādu lieto lielākā daļa rindiņu, t.i., parastais pamatteksts. Rindiņa, kas ievērojami lielāka par šo vidējo, kļūst par Markdown virsrakstu (vislielākās rindiņas kļūst par #, mēreni lielākas — par ##); rindiņa, kas sākas ar aizzīmes simbolu vai atrodas ar atkāpi attiecībā pret apkārtējām rindiņām, kļūst par `- ` saraksta elementu; viss pārējais tiek uzskatīts par pamattekstu un apvienots paragrāfos.

Šī godīgi ir heiristika, nevis strukturāls parsētājs: PDF failiem nav garantēta semantiska iezīmēšana, ir tikai vizuālas instrukcijas, kur tintei jāatrodas, tāpēc dizainera neparasta fontu izvēle dažkārt var apmānīt izmēra salīdzināšanu, un tabulas skaidri ir ārpus darbības jomas — šūnu izkārtojumi nekādā drošā veidā nereducējas uz virsrakstiem, sarakstiem vai paragrāfiem, un šis rīks neizliekas citādi. Katra lappuse izvadē ir skaidri marķēta ar “Page N” atdalītāju, atbilstoši šīs vietnes PDF-uz-tekstu rīka pieņemtajai konvencijai.

Skenētās lappuses saņem tādu pašu godīgu attieksmi kā citur šajā vietnē: lappusei, kas patiešām ir tikai papīra fotogrāfija, vispār nav teksta slāņa, tāpēc tā vietā, lai klusi radītu tukšu sadaļu, rīks atzīmē, kuras lappuses tieši nevarēja nolasīt, un norāda uz Attēls uz tekstu (OCR) rīku šīm lappusēm. Viss notiek lokāli jūsu pārlūkā — nekas netiek augšupielādēts, nav lappušu ierobežojumu, un rezultāts nonāk teksta lodziņā, ko varat kopēt vai saglabāt kā .md failu, kas atverams jebkurā Markdown saprotošā redaktorā.