0

Pretvornik PDF-a u Markdown

Izdvojite tekst PDF-a kao strukturirani Markdown: prepoznavanje stvarnog naslova prema veličini fonta, prepoznavanje popisa prema grafičkim oznakama i uvlaci — a ne jedan ravni zid teksta.

📑

Ovdje povucite i ispustite PDF dokument

ili Kliknite za pregledavanje PDF datoteka

Buy Me a Coffee at ko-fi.com
Obrada... 0%
Učitavanje PDF-a
Izdvajanje teksta s pozicijama
Otkrivanje naslova i strukture
Gotovo

Rezultat

Obična kopija "PDF u tekst" daje vam svaku riječ bez ikakvog oblika: naslov stranice čita se točno kao fusnota, a popis s grafičkim oznakama pretvara se u beskrajnu rečenicu. Ovaj alat ide korak dalje čitanjem stvarne veličine fonta i položaja svake tekstualne stavke iz PDF-a — preko istog pdf.js mehanizma koji koriste i drugi PDF alati ove stranice — i korištenjem tog vizualnog dokaza za rekonstrukciju strukture: naslova, stavki popisa i odlomaka, ispisanih kao Markdown.

Otkrivanje se istinski temelji na mjerenju, a ne na nagađanju. Tekstualne stavke na stranici grupirane su u retke prema tome koliko su blizu njihovi okomiti položaji, veličina fonta svakog retka izračunava se iz vlastite matrice za prikaz teksta, a ta se veličina uspoređuje s srednjom veličinom retka za cijeli dokument — veličinom koju većina redaka zapravo koristi, tj. obični tekst. Redak koji je primjetno veći od tog medijana postaje Markdown naslov (najveći redovi postaju #, oni umjereno veći postaju ##); redak koji počinje znakom grafičke oznake ili je uvučen iza okolnih redaka postaje `- ` stavka popisa; sve ostalo se tretira kao tijelo teksta i spojeno u paragrafe.

Ovo je iskreno heuristika, a ne strukturni parser: PDF datoteke ne sadrže zajamčeno semantičko označavanje, samo vizualne upute o tome kamo ide tinta, tako da neobični izbori fontova dizajnera mogu povremeno zavarati usporedbu veličine, a tablice su izričito izvan opsega - raspored ćelija ne svodi se na naslove, popise ili odlomke na bilo koji pouzdan način, a ovaj alat ne tvrdi suprotno. Svaka je stranica jasno označena razdjelnikom "Stranica N" u ispisu, što odgovara konvenciji koju koristi alat za pretvaranje PDF-a u tekst ove stranice.

Skenirane stranice dobivaju isti pošteni tretman kao i drugdje na ovoj web-lokaciji: stranica koja je zapravo samo fotografija papira uopće nema tekstualni sloj, pa umjesto tihog stvaranja praznog odjeljka, alat točno bilježi koje stranice nije mogao pročitati i za njih upućuje na alat Image to Text (OCR). Sve se izvodi lokalno u vašem pregledniku — ništa se ne učitava, nema ograničenja stranica, a rezultat se nalazi u tekstualnom okviru koji možete kopirati ili spremiti kao .md datoteku koja se otvara u bilo kojem uređivaču koji podržava Markdown.