0

PDF-ből Markdown Converter

PDF-szöveg kibontása strukturált Markdown-ként: valódi fejlécészlelés a betűméretből, listafelismerés jelölésekből és behúzásból – nem egy lapos szövegfal.

📑

Húzd ide a PDF dokumentumot

vagy kattints a PDF fájlok tallózásához

Buy Me a Coffee at ko-fi.com
Feldolgozás... 0%
PDF betöltése
Szöveg kibontása pozíciókkal
Címsorok és szerkezetek észlelése
Kész

Eredmény

Egy egyszerű „PDF-ből szöveggé” kiíratása minden szót megad a formák egyikével sem: az oldal címe pontosan úgy olvasható, mint egy lábjegyzet, és a felsorolásból álló lista futó mondattá változik. Ez az eszköz egy lépéssel tovább megy azáltal, hogy kiolvassa az egyes szövegelemek valódi betűméretét és pozícióját a PDF-ből – ugyanazon a pdf.js motoron keresztül, amelyet a webhely többi PDF-eszköze is használ –, és ezt a vizuális bizonyítékot felhasználva rekonstruálja a szerkezetet: címsorokat, listaelemeket és bekezdéseket, Markdown-ként kiírva.

Az észlelés valóban mérésen alapul, nem pedig egy találgatáson. Az oldalon lévő szövegelemek sorokba vannak csoportosítva függőleges helyzetük közelsége szerint, minden sor betűméretét a rendszer a saját szövegmegjelenítő mátrixából számítja ki, és ezt a méretet a teljes dokumentum középső sorméretével hasonlítja össze – azzal a mérettel, amelyet a legtöbb sor ténylegesen használ, azaz a normál törzsszöveg. A mediánnál észrevehetően nagyobb sor Markdown fejléc lesz (a legnagyobb sorok #, a mérsékelten nagyobbak ## lesznek); egy felsorolásjellel kezdődő vagy a környező sorok mögött behúzott sor `- ` listaelemmé válik; minden mást a rendszer törzsszövegként kezel, és bekezdésekké egyesíti.

Ez őszintén szólva egy heurisztikus, nem pedig strukturális elemző: a PDF-fájlok nem tartalmaznak garantált szemantikai jelölést, csak vizuális utasításokat tartalmaznak arra vonatkozóan, hogy hova kerül a tinta, így a tervezők szokatlan betűtípus-választásai időnként megtéveszthetik a méret-összehasonlítást, a táblázatok pedig kifejezetten kívül esnek – a cellaelrendezések semmilyen megbízható módon nem redukálódnak címsorokká, listákká vagy bekezdésekké, és ez az eszköz sem tesz mást. Minden oldal jól láthatóan meg van jelölve egy "N oldal" elválasztóval a kimenetben, ami megfelel a webhely PDF-szövegté alakító eszköze által használt konvenciónak.

A beszkennelt oldalakat ugyanolyan őszinte bánásmódban részesítik, mint máshol ezen a webhelyen: egy lapon, amely valójában csak egy papír fényképe, nincs szövegréteg, így az eszköz ahelyett, hogy csendben létrehozna egy üres részt, pontosan megjegyzi, hogy mely oldalakat nem tudta elolvasni, és rámutat az ezekhez tartozó Kép szöveggé (OCR) eszközre. Minden helyileg fut a böngészőben – semmi sem kerül feltöltésre, nincsenek oldalkorlátozások, és az eredmény egy szövegmezőbe kerül, amelyet másolhat vagy menthet .md fájlként, amely bármely Markdown-tudatos szerkesztőben megnyílik.