0

Konverter PDF ke Penurunan Harga

Ekstrak teks PDF sebagai penurunan harga terstruktur: deteksi judul nyata dari ukuran font, deteksi daftar dari poin dan indentasi — bukan satu dinding teks datar.

📑

Seret & Jatuhkan dokumen PDF di sini

atau Klik untuk menelusuri file PDF

Buy Me a Coffee at ko-fi.com
Memproses... 0%
Memuat PDF
Mengekstraksi teks dengan posisi
Mendeteksi judul dan struktur
Selesai

Hasil

Dump "PDF ke teks" biasa memberi Anda setiap kata tanpa bentuk apa pun: judul halaman terbaca persis seperti catatan kaki, dan daftar berpoin berubah menjadi kalimat lanjutan. Alat ini melangkah lebih jauh dengan membaca ukuran dan posisi font sebenarnya setiap item teks dari PDF — melalui mesin pdf.js yang sama dengan yang digunakan alat PDF lainnya di situs ini — dan menggunakan bukti visual tersebut untuk merekonstruksi struktur: judul, item daftar, dan paragraf, ditulis sebagai Penurunan harga.

Pendeteksiannya benar-benar berdasarkan pengukuran, bukan tebakan yang dibuat-buat. Item teks pada halaman dikelompokkan menjadi beberapa baris berdasarkan seberapa dekat posisi vertikalnya, ukuran font setiap baris dihitung dari matriks rendering teksnya sendiri, dan ukuran tersebut dibandingkan dengan ukuran garis median untuk keseluruhan dokumen — ukuran yang sebenarnya digunakan sebagian besar baris, yaitu teks isi biasa. Garis yang terlihat lebih besar dari median tersebut menjadi judul penurunan harga (garis terbesar menjadi #, garis yang cukup besar menjadi ##); sebuah baris yang dimulai dengan karakter poin atau menjorok melewati garis di sekitarnya menjadi item daftar `- `; segala sesuatu yang lain diperlakukan sebagai teks isi dan digabungkan menjadi paragraf.

Sejujurnya ini adalah heuristik, bukan pengurai struktural: File PDF tidak memiliki jaminan markup semantik, hanya instruksi visual tentang ke mana tinta akan pergi, sehingga pilihan font yang tidak biasa dari seorang desainer terkadang dapat menipu perbandingan ukuran, dan tabel secara eksplisit berada di luar cakupan — tata letak sel tidak direduksi menjadi judul, daftar, atau paragraf dengan cara apa pun yang dapat diandalkan, dan alat ini tidak berpura-pura sebaliknya. Setiap halaman ditandai dengan jelas dengan pemisah "Halaman N" pada keluarannya, sesuai dengan konvensi yang digunakan oleh alat PDF-ke-teks situs ini.

Halaman yang dipindai mendapat perlakuan jujur yang sama seperti di tempat lain di situs ini: halaman yang sebenarnya hanya berupa foto kertas tidak memiliki lapisan teks sama sekali, jadi alih-alih secara diam-diam membuat bagian kosong, alat ini mencatat dengan tepat halaman mana yang tidak dapat dibaca dan menunjuk ke alat Image to Text (OCR) untuk halaman tersebut. Semuanya berjalan secara lokal di browser Anda — tidak ada yang diunggah, tidak ada batasan halaman, dan hasilnya muncul di kotak teks yang dapat Anda salin atau simpan sebagai file .md yang terbuka di editor Markdown-aware mana pun.