Prevodník PDF na text
Extrahujte obyčajný text z textovej vrstvy PDF v prehliadači, stránku po stránke, pripravený na kopírovanie alebo stiahnutie.
Výsledok
PDF sa ľahko číta, ale je nepohodlné na opätovné použitie: nemôžete vždy vybrať jeho text čisto a ručné kopírovanie strany po stránke je únavné. Tento nástroj extrahuje obyčajný text z textovej vrstvy PDF jedným prechodom úplne vo vašom prehliadači a odovzdá ho späť pripravený na kopírovanie alebo sťahovanie – bez nahrávania, bez účtu, bez vodoznaku.
Extrakcia funguje stránku po stránke. Text každej strany je vytiahnutý z vlastnej textovej vrstvy dokumentu a oddelený jasnou značkou „Strana N“, takže päťdesiatstranová správa zostane usporiadaná namiesto toho, aby sa zrútila do jednej nerozlíšenej steny slov. Výsledok sa zobrazí v textovom poli, ktoré si môžete prečítať, vybrať, skopírovať do schránky alebo uložiť ako súbor .txt, ktorý sa otvorí kdekoľvek.
Tu záleží na úprimnosti: veľa PDF sú skeny – fotografie papiera bez textovej vrstvy. Keď sa to stane, žiadna extrakcia nenájde slová, takže namiesto vrátenia tichého prázdneho súboru nástroj detekuje prázdny výsledok a povie vám, že dokument je naskenovaný, a nasmeruje vás na nástroj Image to Text (OCR), ktorý skutočne dokáže čítať pixely. Toto je extraktor textu, nie OCR engine, a nepredstiera, že konvertuje PDF na upraviteľný dokument programu Word.
Pretože celý proces beží na vašom vlastnom počítači prostredníctvom jadra pdf.js, dôverné zmluvy, výpisy a záznamy nikdy neopustia zariadenie – neexistujú žiadne obmedzenia počtu stránok a žiadna spätná cesta na server. Ak potrebujete stránky ako obrázky a nie ako text, nástroj PDF-to-JPG vykreslí každú stránku ako obrázok.