0

PDF u Markdown pretvarač

Izdvojite tekst PDF-a kao strukturirani Markdown: stvarno otkrivanje naslova na temelju veličine fonta, otkrivanje popisa na temelju grafičkih oznaka i uvlačenja — a ne ravna gomila teksta.

🔒 U potpunosti se obrađuje u vašem pregledniku — ništa što ovdje unesete nikada se ne učitava.

📑

Povucite i ispustite PDF dokument ovdje

ili kliknite za pregled PDF datoteka

Obrada... 0%
Učitavanje PDF-a
Izdvajanje teksta s pozicijama
Otkrivanje naslova i strukture
Gotovo

Rezultat

Obično „PDF u tekst“ izbacivanje daje vam svaku riječ, ali bez ikakvog oblika: naslov stranice čita se kao fusnota, a popis s grafičkim oznakama pretvara se u neprekinutu rečenicu. Ovaj alat ide korak dalje čitajući stvarne veličine fontova i položaje svakog tekstualnog elementa iz PDF-a — putem istog pdf.js mehanizma koji koriste ostali PDF alati na ovom mjestu — i koristeći te vizualne dokaze za rekonstrukciju strukture: naslovi, stavke popisa i odlomci, zapisani kao Markdown.

Otkrivanje se doista temelji na mjerenjima, a ne na nagađanju prerušenom u mjerenje. Tekstualni elementi na stranici grupiraju se u retke prema blizini svojih vertikalnih položaja, veličina fonta svakog retka izračunava se iz njegove vlastite matrice prikaza teksta, a ta se veličina uspoređuje sa srednjom veličinom retka za cijeli dokument — veličinom koju većina redaka stvarno koristi, tj. obični osnovni tekst. Redak osjetno veći od tog medijana postaje Markdown naslov (najveći redovi postaju #, umjereno veći postaju ##); redak koji počinje grafičkom oznakom ili je uvučen u odnosu na okolne retke postaje `- ` stavka popisa; sve ostalo tretira se kao osnovni tekst i spaja u odlomke.

Iskreno, ovo je heuristika, a ne strukturalni parser: PDF datoteke nemaju zajamčeno semantičko označavanje, već samo vizualne upute o tome gdje ide tinta, tako da neobični fontovski izbori dizajnera ponekad mogu zavarati usporedbu veličina, a tablice su izričito izvan dosega — raspored ćelija ne može se pouzdano svesti na naslove, popise ili odlomke i ovaj alat ne glumi suprotno. Svaka je stranica jasno označena razdjelnikom „Page N“ u izlazu, u skladu s konvencijom koju koristi alat za pretvaranje PDF-a u tekst na ovom mjestu.

Skenirane stranice dobivaju isti iskren tretman kao i drugdje na ovom mjestu: stranica koja je zapravo samo fotografija papira uopće nema sloj teksta, pa umjesto da tiho proizvede prazan odjeljak, alat bilježi točno koje stranice nije mogao pročitati i upućuje na alat Slika u tekst (OCR) za njih. Sve se izvodi lokalno u vašem pregledniku — ništa se ne učitava, nema ograničenja broja stranica, a rezultat stiže u tekstualni okvir koji možete kopirati ili spremiti kao .md datoteku koja se otvara u bilo kojem uređivaču koji podržava Markdown.