PDF to Markdown Converter
Ekstrak teks PDF sebagai Markdown berstruktur: pengesanan tajuk sebenar daripada saiz fon, pengesanan senarai daripada peluru dan inden — bukan satu dinding teks yang rata.
Hasilnya
Longgokan "PDF ke teks" biasa memberi anda setiap perkataan tanpa bentuk: tajuk halaman dibaca betul-betul seperti nota kaki dan senarai bertitik tumpu bertukar menjadi ayat larian. Alat ini melangkah lebih jauh dengan membaca saiz dan kedudukan fon sebenar setiap item teks daripada PDF — melalui enjin pdf.js yang sama yang digunakan oleh alat PDF lain tapak ini — dan menggunakan bukti visual itu untuk membina semula struktur: tajuk, item senarai dan perenggan, ditulis sebagai Markdown.
Pengesanan adalah benar-benar berasaskan pengukuran, bukan tekaan yang disandang sebagai satu. Item teks pada halaman dihimpunkan ke dalam baris mengikut jarak kedudukan menegaknya, saiz fon setiap baris dikira daripada matriks pemaparan teksnya sendiri, dan saiz itu dibandingkan dengan saiz garisan median untuk keseluruhan dokumen — saiz kebanyakan baris sebenarnya digunakan, iaitu teks badan biasa. Garis yang ketara lebih besar daripada median itu menjadi tajuk Markdown (garisan terbesar menjadi #, yang sederhana besar menjadi ##); baris yang bermula dengan aksara peluru atau duduk melepasi garisan sekeliling menjadi item senarai `- `; semua yang lain dianggap sebagai teks badan dan digabungkan menjadi perenggan.
Sejujurnya, ini adalah heuristik, bukan penghurai struktur: Fail PDF tidak membawa penanda semantik yang terjamin, hanya arahan visual untuk ke mana dakwat pergi, jadi pilihan fon luar biasa pereka kadang-kadang boleh menipu perbandingan saiz dan jadual secara eksplisit di luar skop — reka letak sel tidak dikurangkan kepada tajuk, senarai atau perenggan, dan ini sebaliknya tidak boleh dipercayai, dan ini tidak boleh dipercayai dalam apa-apa cara, dan ini tidak boleh dipercayai. Setiap halaman ditandakan dengan jelas dengan pembahagi "Halaman N" dalam output, sepadan dengan konvensyen yang digunakan oleh alat PDF-ke-teks tapak ini.
Halaman yang diimbas mendapat layanan jujur yang sama seperti di tempat lain di tapak ini: halaman yang benar-benar hanya gambar kertas tidak mempunyai lapisan teks sama sekali, jadi bukannya menghasilkan bahagian kosong secara senyap, alat itu mencatat dengan tepat halaman yang tidak dapat dibaca dan menunjuk ke alat Imej ke Teks (OCR) untuk itu. Semuanya berjalan secara setempat dalam penyemak imbas anda — tiada apa-apa yang dimuat naik, tiada had halaman dan hasilnya sampai ke dalam kotak teks yang anda boleh salin atau simpan sebagai fail .md yang dibuka dalam mana-mana editor yang menyedari Markdown.