Penukar PDF ke Teks
Ekstrak teks biasa daripada lapisan teks PDF dalam penyemak imbas, halaman demi halaman, sedia untuk disalin atau dimuat turun.
Hasilnya
PDF mudah dibaca tetapi janggal untuk digunakan semula: anda tidak boleh sentiasa memilih teksnya dengan bersih dan menyalin halaman demi halaman dengan tangan adalah membosankan. Alat ini mengekstrak teks biasa daripada lapisan teks PDF dalam satu laluan, sepenuhnya di dalam penyemak imbas anda dan menyerahkannya kembali sedia untuk disalin atau dimuat turun — tiada muat naik, tiada akaun, tiada tera air.
Pengekstrakan berfungsi halaman demi halaman. Teks setiap halaman ditarik dari lapisan teks dokumen sendiri dan dipisahkan oleh penanda "Halaman N" yang jelas, jadi laporan lima puluh halaman kekal teratur dan bukannya runtuh menjadi satu dinding perkataan yang tidak dibezakan. Hasilnya sampai ke dalam kotak teks yang anda boleh baca, pilih, salin ke papan keratan atau simpan sebagai fail .txt yang dibuka di mana-mana sahaja.
Kejujuran penting di sini: banyak PDF adalah imbasan — gambar kertas tanpa lapisan teks sama sekali. Apabila itu berlaku, tiada jumlah pengekstrakan akan menemui perkataan, jadi bukannya mengembalikan fail kosong secara senyap, alat itu mengesan hasil kosong dan memberitahu anda bahawa dokumen itu adalah imbasan, menunjukkan anda ke alat Imej ke Teks (OCR) yang sebenarnya boleh membaca piksel. Ini ialah pengekstrak teks, bukan enjin OCR, dan ia tidak berpura-pura menukar PDF kepada dokumen Word yang boleh diedit.
Kerana keseluruhan proses berjalan pada mesin anda sendiri melalui enjin pdf.js, kontrak sulit, penyata dan rekod tidak pernah meninggalkan peranti — tiada had halaman dan tiada pelayan pergi-balik. Jika anda memerlukan halaman sebagai gambar dan bukannya teks, alat PDF-ke-JPG menjadikan setiap halaman kepada imej sebaliknya.