0

PDF į Markdown konverteris

Išskleiskite PDF tekstą kaip struktūruotą Markdown: tikras antraštės aptikimas pagal šrifto dydį, sąrašo aptikimas iš ženklelių ir įtraukos – ne viena plokščia teksto siena.

📑

Nuvilkite PDF dokumentą čia

arba Spustelėkite norėdami naršyti PDF failus

Buy Me a Coffee at ko-fi.com
Apdorojama... 0%
Įkeliamas PDF
Teksto ištraukimas su pozicijomis
Antraštės ir struktūros aptikimas
Atlikta

Rezultatas

Paprastas išrašas „PDF į tekstą“ suteikia jums kiekvieną žodį be jokios formos: puslapio pavadinimas skaitomas lygiai taip pat, kaip išnaša, o sąrašas su ženkleliais virsta vykdomu sakiniu. Šis įrankis žengia dar vieną žingsnį – nuskaito kiekvieno teksto elemento tikrąjį šrifto dydį ir padėtį iš PDF – per tą patį pdf.js variklį, kurį naudoja kiti šios svetainės PDF įrankiai – ir naudoja šiuos vaizdinius įrodymus struktūrai atkurti: antraštes, sąrašo elementus ir pastraipas, parašytas kaip žymėjimas.

Aptikimas iš tikrųjų pagrįstas matavimais, o ne spėlionėmis. Puslapio teksto elementai sugrupuojami į eilutes pagal jų vertikalią padėtį, kiekvienos eilutės šrifto dydis apskaičiuojamas pagal atskirą teksto atvaizdavimo matricą ir šis dydis lyginamas su viso dokumento vidutiniu eilutės dydžiu – dydžiu, kurį iš tikrųjų naudoja dauguma eilučių, t. y. įprastą pagrindinį tekstą. Pastebimai didesnė už tą medianą eilutė tampa Markdown antrašte (didžiausios eilutės tampa #, vidutiniškai didesnės tampa ##); eilutė, kuri prasideda ženkleliu arba yra įtraukta už aplinkinių eilučių, tampa sąrašo elementu „-“; visa kita traktuojama kaip turinys ir sujungiama į pastraipas.

Tai euristinė, o ne struktūrinė analizavimo priemonė: PDF failuose nėra garantuoto semantinio žymėjimo, tik vaizdinės instrukcijos, kur eina rašalas, todėl neįprasti dizainerio šriftų pasirinkimai kartais gali suklaidinti dydžio palyginimą, o lentelės aiškiai nepatenka į taikymo sritį – langelių išdėstymas jokiu patikimu būdu nesumažėja į antraštes, sąrašus ar pastraipas, o šis įrankis nepretenduoja kitaip. Kiekvienas puslapis išvestyje aiškiai pažymėtas „Puslapio N“ skirstytuvu, atitinkančiu šios svetainės PDF į tekstą įrankio taikomą tvarką.

Su nuskaitytais puslapiais elgiamasi taip pat sąžiningai, kaip ir kitur šioje svetainėje: puslapis, kuris iš tikrųjų yra tik popierinė nuotrauka, neturi jokio teksto sluoksnio, todėl užuot tyliai kūręs tuščią skiltį, įrankis tiksliai pažymi, kurių puslapių nepavyko perskaityti, ir nurodo tiems skirtą įrankį Vaizdas į tekstą (OCR). Viskas veikia lokaliai jūsų naršyklėje – niekas neįkeliama, nėra puslapių apribojimų, o rezultatas patenka į teksto laukelį, kurį galite nukopijuoti arba išsaugoti kaip .md failą, kuris atidaromas bet kuriame Markdown-aware redaktoriuje.