Penukar PDF ke Markdown
Ekstrak teks PDF sebagai Markdown berstruktur: pengesanan tajuk sebenar daripada saiz fon, pengesanan senarai daripada peluru dan inden — bukan satu dinding teks yang rata.
🔒 Diproses sepenuhnya dalam penyemak imbas anda — tiada apa yang anda masukkan di sini pernah dimuat naik.
Keputusan
Alat “PDF ke teks” biasa memberikan setiap perkataan tanpa sebarang bentuk: tajuk halaman terbaca sama seperti nota kaki, dan senarai berpeluru menjadi ayat yang bersambung-sambung. Alat ini selangkah lebih maju dengan membaca saiz fon dan kedudukan sebenar setiap item teks daripada PDF — melalui enjin pdf.js yang sama digunakan oleh alat PDF lain di laman ini — dan menggunakan bukti visual tersebut untuk membina semula struktur: tajuk, item senarai dan perenggan, yang ditulis sebagai Markdown.
Pengesanan ini benar-benar berasaskan pengukuran, bukan tekaan yang disamar sebagai satu. Item teks pada halaman dikumpulkan ke dalam baris berdasarkan seberapa dekat kedudukan menegak mereka, saiz fon setiap baris dikira daripada matriks pemaparan teksnya sendiri, dan saiz itu dibandingkan dengan saiz baris median untuk keseluruhan dokumen — saiz yang paling banyak digunakan oleh baris, iaitu teks badan biasa. Baris yang ketara lebih besar daripada median itu menjadi tajuk Markdown (baris paling besar menjadi #, yang sederhana lebih besar menjadi ##); baris yang bermula dengan aksara peluru atau terinden melebihi baris sekelilingnya menjadi item senarai `- `; semua yang lain dianggap sebagai teks badan dan digabungkan menjadi perenggan.
Secara jujur, ini adalah heuristik, bukan penghurai berstruktur: fail PDF tidak membawa penanda semantik yang terjamin, hanya arahan visual tentang tempat letak dakwat, jadi pilihan fon luar biasa oleh pereka bentuk kadangkala boleh mengelirukan perbandingan saiz, dan jadual secara jelas di luar skop — susun atur sel tidak boleh diringkaskan menjadi tajuk, senarai, atau perenggan dengan cara yang boleh diharap, dan alat ini tidak berpura-pura sebaliknya. Setiap halaman ditandai dengan jelas menggunakan pembahagi “Halaman N” dalam output, mengikut kelaziman yang digunakan oleh alat PDF-ke-teks di laman ini.
Halaman imbasan mendapat layanan jujur yang sama seperti di tempat lain di laman ini: halaman yang sebenarnya hanya gambar kertas tidak mempunyai lapisan teks langsung, jadi daripada menghasilkan bahagian kosong secara senyap, alat ini mencatatkan halaman mana yang tidak dapat dibaca dan merujuk kepada alat Imej ke Teks (OCR) untuk halaman tersebut. Semuanya berjalan secara setempat dalam pelayar anda — tiada apa-apa yang dimuat naik, tiada had halaman, dan hasilnya dipaparkan dalam kotak teks yang boleh anda salin atau simpan sebagai fail .md yang boleh dibuka dalam mana-mana editor yang menyokong Markdown.