Konverteris iš PDF į tekstą
Puslapis po puslapio ištraukite paprastą tekstą iš PDF teksto sluoksnio naršyklėje, paruoštą kopijuoti arba atsisiųsti.
Rezultatas
PDF failą lengva skaityti, bet nepatogu pakartotinai naudoti: ne visada galite aiškiai pasirinkti jo tekstą, o kopijuoti puslapį po puslapio ranka yra nuobodu. Šis įrankis vienu metu ištraukia paprastą tekstą iš PDF teksto sluoksnio, visiškai naršyklėje, ir grąžina jį paruoštą kopijuoti arba atsisiųsti – jokio įkėlimo, paskyros ar vandens ženklo.
Ištraukimas veikia puslapis po puslapio. Kiekvieno puslapio tekstas ištraukiamas iš paties dokumento teksto sluoksnio ir atskiriamas aiškiu „Puslapio N“ žymekliu, todėl penkiasdešimties puslapių ataskaita lieka sutvarkyta, o ne sugriūna į vieną nediferencijuotą žodžių sieną. Rezultatas patenka į teksto laukelį, kurį galite perskaityti, pasirinkti, nukopijuoti į mainų sritį arba išsaugoti kaip .txt failą, kuris atidaromas bet kur.
Čia svarbu sąžiningumas: daugelis PDF failų yra nuskaityti – popierinės nuotraukos be jokio teksto sluoksnio. Kai taip atsitiks, joks ištraukimas neras žodžių, todėl užuot grąžinęs tyliai tuščią failą, įrankis aptinka tuščią rezultatą ir praneša, kad dokumentas yra nuskaitytas, nukreipdamas į vaizdo į tekstą (OCR) įrankį, kuris iš tikrųjų gali nuskaityti pikselius. Tai teksto ekstraktorius, o ne OCR variklis, ir jis nepretenduoja į PDF konvertavimą į redaguojamą „Word“ dokumentą.
Kadangi visas procesas vyksta jūsų kompiuteryje per pdf.js modulį, konfidencialios sutartys, pareiškimai ir įrašai niekada nepalieka įrenginio – nėra puslapių apribojimų ir serverio kelionės pirmyn ir atgal. Jei jums reikia puslapių kaip paveikslėlių, o ne kaip teksto, įrankis iš PDF į JPG paverčia kiekvieną puslapį kaip vaizdą.