PDF į Markdown konverteris
Ištraukite PDF tekstą kaip struktūrizuotą Markdown: realus antraščių aptikimas pagal šrifto dydį, sąrašų aptikimas pagal ženklelius ir įtraukas – ne plokščia teksto siena.
🔒 Visiškai apdorojama jūsų naršyklėje – niekas, kurį čia įvedėte, niekada neįkeliama.
Rezultatas
Paprastas „PDF į tekstą“ išrašymas pateikia kiekvieną žodį, tačiau be jokios struktūros: puslapio antraštė skaitosi taip pat kaip išnaša, o sąrašas su ženkleliais virsta vientisu sakiniu. Šis įrankis žengia žingsnį toliau – nuskaito kiekvieno teksto elemento realų šrifto dydį ir padėtį PDF faile (naudodamas tą patį pdf.js variklį, kurį naudoja kiti šios svetainės PDF įrankiai) ir, remdamasis šiais vizualiniais įrodymais, atkuria struktūrą: antraštes, sąrašo elementus ir pastraipas, išreikštas Markdown formatu.
Aptikimas iš tikrųjų pagrįstas matavimais, o ne spėjimu, užmaskuotu kaip toks. Puslapyje esantys teksto elementai sugrupuojami į eilutes pagal jų vertikalių pozicijų artumą, kiekvienos eilutės šrifto dydis apskaičiuojamas pagal jos pačios teksto atvaizdavimo matricą, o šis dydis lyginamas su viso dokumento medianiniu eilutės dydžiu – tai dydis, kurį iš tikrųjų naudoja dauguma eilučių, t. y. paprastas pagrindinis tekstas. Eilutė, pastebimai didesnė už šią medianą, tampa Markdown antrašte (didžiausios eilutės virsta #, vidutiniškai didesnės – ##); eilutė, prasidedanti ženklelio simboliu arba esanti įtraukta labiau nei aplinkinės eilutės, tampa `- ` sąrašo elementu; visa kita laikoma pagrindiniu tekstu ir suliejama į pastraipas.
Atvirai kalbant, tai yra euristika, o ne struktūrinis analizatorius: PDF failai neturi garantuoto semantinio žymėjimo, tik vizualines instrukcijas, kur dėti rašalą, todėl dizainerio neįprasti šrifto pasirinkimai kartais gali suklaidinti dydžio palyginimą, o lentelės sąmoningai neapdorojamos – langelių išdėstymas patikimai nesuvedamas į antraštes, sąrašus ar pastraipas, ir šis įrankis neapsimetinėja kitaip. Kiekvienas puslapis aiškiai pažymėtas skiriamąja eilute „Puslapis N“ išvestyje – taip pat, kaip ir šios svetainės PDF į tekstą įrankyje.
Nuskenuotiems puslapiams taikomas toks pat sąžiningas požiūris kaip ir kitur šioje svetainėje: puslapis, kuris iš esmės yra tik popieriaus nuotrauka, visiškai neturi teksto sluoksnio, todėl užuot tylomis sukūrus tuščią sekciją, įrankis tiksliai pažymi, kurių puslapių negalėjo perskaityti, ir nukreipia į Vaizdo į tekstą (OCR) įrankį. Viskas vyksta vietoje jūsų naršyklėje – niekas neįkeliama, nėra puslapių limitų, o rezultatas patenka į teksto lauką, kurį galite nukopijuoti arba išsaugoti kaip .md failą, atidaromą bet kuriame Markdown palaikančiame redaktoriuje.