Pretvornik PDF v besedilo
Izvlecite navadno besedilo iz besedilne plasti PDF-ja v brskalniku, stran za stranjo, pripravljeno za kopiranje ali prenos.
Rezultat
PDF je enostaven za branje, a neroden za ponovno uporabo: ne morete vedno jasno izbrati njegovega besedila in ročno kopiranje strani za stranjo je dolgočasno. To orodje v enem prehodu izvleče golo besedilo iz besedilne plasti PDF-ja, v celoti znotraj vašega brskalnika, in ga preda nazaj, pripravljenega za kopiranje ali prenos – brez nalaganja, brez računa, brez vodnega žiga.
Ekstrakcija poteka stran za stranjo. Besedilo vsake strani je povzeto iz lastne besedilne plasti dokumenta in ločeno z jasnim označevalcem »Stran N«, tako da petdesetstransko poročilo ostane organizirano, namesto da bi se sesulo v en nediferenciran zid besed. Rezultat pristane v besedilnem polju, ki ga lahko preberete, izberete, kopirate v odložišče ali shranite kot datoteko .txt, ki se odpre kjer koli.
Iskrenost je tukaj pomembna: veliko datotek PDF je skeniranih fotografij – fotografij papirja brez plasti besedila. Ko se to zgodi, nobena ekstrakcija ne bo našla besed, zato orodje namesto vrne tiho prazno datoteko zazna prazen rezultat in vam pove, da je dokument optično prebran, ter vas usmeri na orodje Image to Text (OCR), ki lahko dejansko bere slikovne pike. To je ekstraktor besedila, ne mehanizem OCR, in ne pretvarja se, da pretvori PDF v Wordov dokument, ki ga je mogoče urejati.
Ker celoten postopek teče na vašem računalniku prek mehanizma pdf.js, zaupne pogodbe, izjave in zapisi nikoli ne zapustijo naprave – ni omejitev strani in povratnega potovanja strežnika. Če potrebujete strani kot slike in ne besedilo, orodje PDF-to-JPG namesto tega vsako stran upodobi v sliko.