0

PDF Markdown konverter

Nyerd ki a PDF szövegét strukturált Markdownként: valós címsor-felismerés betűméret alapján, listaelem-felismerés felsorolásjelekből és behúzásból – nem csak egy sima szövegfolyam.

🔒 Teljesen a böngészőjében dolgozzák fel – soha semmi, amit itt beírt, nem kerül feltöltésre.

📑

Húzd ide a PDF dokumentumot

vagy kattints a PDF fájlok tallózásához

Feldolgozás... 0%
PDF betöltése
Szöveg kinyerése pozíciókkal
Címsorok és szerkezet észlelése
Kész

Eredmény

Egy sima „PDF-ből szöveg” kimenetnél megkapod az összes szót, de a forma elveszik: egy oldalcím pontosan úgy néz ki, mint egy lábjegyzet, a felsorolás pedig összefüggő mondattá folyik. Ez az eszköz egy lépéssel továbbmegy: kiolvassa minden szövegelem valós betűméretét és pozícióját a PDF-ből – ugyanazzal a pdf.js motorral, amit az oldal többi PDF-eszköze is használ –, és e vizuális bizonyítékok alapján rekonstruálja a szerkezetet: címsorokat, listaelemeket és bekezdéseket, Markdown formátumban.

Az észlelés valóban mérésen alapul, nem csupán felöltöztetett találgatás. Az oldalon lévő szövegelemek soraikba rendeződnek a függőleges pozíciójuk közelsége alapján, minden sor betűmérete a saját szöveg-megjelenítési mátrixából kerül kiszámításra, és ez a méret a teljes dokumentum medián sorméretéhez viszonyítódik – ahhoz a mérethez, amit a legtöbb sor ténylegesen használ, vagyis a hétköznapi szövegtörzshöz. Egy e mediánnál észrevehetően nagyobb sor Markdown címsorrá válik (a legnagyobb sorokból #, a mérsékelten nagyobbakból ## lesz); egy sor, amely felsorolásjellel kezdődik, vagy a környező sorokhoz képest beljebb kezdődik, `- ` listaelemmé válik; minden más szövegtörzsnek minősül, és bekezdésekbe kerül összevonásra.

Ez őszintén szólva egy heurisztika, nem strukturális elemző: a PDF-fájlok nem hordoznak garantált szemantikus jelölést, csak vizuális utasításokat arra vonatkozóan, hová kerüljön tinta, így egy tervező szokatlan betűválasztása időnként megtévesztheti a méret-összehasonlítást, a táblázatok pedig kifejezetten nem tartoznak a hatókörbe – a cellaelrendezések nem redukálhatók megbízhatóan címsorokra, listaelemekre vagy bekezdésekre, és ez az eszköz nem is tesz úgy, mintha ez másképp lenne. Minden oldal egyértelműen meg van jelölve egy „Oldal N” elválasztóval a kimenetben, követve az oldal PDF-szöveg eszközének konvencióját.

A szkennelt oldalak ugyanazt az őszinte kezelést kapják, mint az oldal többi részén: egy oldal, ami valójában csak egy fénykép a papírról, egyáltalán nem rendelkezik szövegréteggel, így ahelyett, hogy csendben üres szakaszt hozna létre, az eszköz pontosan megjegyzi, mely oldalakat nem tudta olvasni, és ezekhez a Kép szöveggé (OCR) eszközre mutat. Minden helyben, a böngésződben fut – semmi nem kerül feltöltésre, nincsenek oldalkorlátok, és az eredmény egy szövegdobozban jelenik meg, amit kimásolhatsz, vagy elmenthetsz .md fájlként, ami bármely Markdown-támogatással rendelkező szerkesztőben megnyitható.