0

Konverter PDF ke Markdown

Ekstrak teks PDF menjadi Markdown terstruktur: deteksi heading nyata dari ukuran font, deteksi daftar dari bullet dan indentasi — bukan sekadar teks polos tanpa bentuk.

🔒 Diproses sepenuhnya di browser Anda — apa pun yang Anda masukkan di sini tidak akan pernah diunggah.

📑

Seret & Lepas dokumen PDF di sini

atau Klik untuk menelusuri file PDF

Memproses... 0%
Memuat PDF
Mengekstrak teks beserta posisinya
Mendeteksi heading dan struktur
Selesai

Hasil

Sekadar “PDF to text” hanya memberi Anda semua kata tanpa bentuk: judul halaman terbaca seperti catatan kaki, dan daftar berubah menjadi kalimat sambung. Alat ini selangkah lebih maju dengan membaca ukuran dan posisi font asli setiap item teks dari PDF — melalui mesin pdf.js yang sama yang digunakan alat PDF lain situs ini — lalu menggunakan bukti visual itu untuk menyusun ulang struktur: heading, item daftar, dan paragraf, ditulis sebagai Markdown.

Deteksinya benar-benar berbasis pengukuran, bukan sekadar perkiraan. Item teks pada halaman dikelompokkan menjadi baris berdasarkan kedekatan posisi vertikalnya, ukuran font setiap baris dihitung dari matriks perenderan teksnya sendiri, lalu ukuran itu dibandingkan dengan ukuran median baris untuk seluruh dokumen — ukuran yang paling banyak dipakai, yaitu teks isi biasa. Baris yang jelas lebih besar dari median itu menjadi heading Markdown (baris terbesar menjadi #, yang cukup besar menjadi ##); baris yang diawali karakter bullet atau menjorok lebih dalam dari baris sekitarnya menjadi item daftar `- `; selebihnya dianggap teks isi dan digabung menjadi paragraf.

Sejujurnya ini adalah heuristik, bukan parser struktural: file PDF tidak memiliki markup semantik terjamin, hanya instruksi visual tentang di mana tinta diletakkan, jadi pilihan font tak lazim seorang desainer kadang bisa mengecoh perbandingan ukuran, dan tabel secara tegas di luar cakupan — tata letak sel tidak bisa disederhanakan menjadi heading, daftar, atau paragraf secara andal, dan alat ini tidak berpura-pura demikian. Setiap halaman ditandai jelas dengan pemisah “Halaman N” di hasil, mengikuti konvensi yang dipakai alat PDF-ke-teks situs ini.

Halaman pindaian mendapat perlakuan jujur yang sama seperti di tempat lain di situs ini: halaman yang hanya berupa foto kertas tidak punya lapisan teks sama sekali, jadi alih-alih diam-diam menghasilkan bagian kosong, alat ini mencatat persis halaman mana yang tidak bisa dibaca dan mengarahkan ke alat Gambar ke Teks (OCR) untuk itu. Semuanya berjalan lokal di browser Anda — tidak ada yang diunggah, tanpa batasan halaman, dan hasilnya muncul di kotak teks yang bisa Anda salin atau simpan sebagai file .md yang bisa dibuka di editor Markdown apa pun.