0

ตัวแปลง PDF เป็น Markdown

ดึงข้อความจาก PDF เป็น Markdown ที่มีโครงสร้าง: ตรวจจับหัวข้อจริงจากขนาดฟอนต์, ตรวจจับรายการจากหัวข้อย่อยและการย่อหน้า — ไม่ใช่ข้อความก้อนเดียวราบเรียบ

🔒 ประมวลผลทั้งหมดในเบราว์เซอร์ของคุณ — ไม่มีการอัปโหลดสิ่งใดที่คุณป้อนที่นี่

📑

ลากและวางเอกสาร PDF ที่นี่

หรือคลิกเพื่อเรียกดูไฟล์ PDF

กำลังประมวลผล... 0%
กำลังโหลด PDF
กำลังดึงข้อความพร้อมตำแหน่ง
กำลังตรวจจับหัวข้อและโครงสร้าง
เสร็จแล้ว

ผลลัพธ์

การถ่ายข้อความ "PDF เป็นข้อความ" ธรรมดาให้ทุกคำแต่ไม่มีรูปทรง: ชื่อหน้าอ่านเหมือนเชิงอรรถ และรายการหัวข้อย่อยกลายเป็นประโยคต่อเนื่องกัน เครื่องมือนี้พัฒนาไปอีกขั้นโดยการอ่านขนาดฟอนต์และตำแหน่งจริงของแต่ละรายการข้อความจาก PDF — ผ่านไลบรารี pdf.js ตัวเดียวกับที่เครื่องมือ PDF อื่นๆ ของเว็บนี้ใช้ — และใช้หลักฐานภาพนั้นเพื่อสร้างโครงสร้างขึ้นใหม่: หัวข้อ รายการ และย่อหน้า เขียนออกมาเป็น Markdown

การตรวจจับนี้อิงจากการวัดอย่างแท้จริง ไม่ใช่การเดาที่แต่งขึ้น รายการข้อความบนหน้าถูกจัดกลุ่มเป็นบรรทัดตามความใกล้ชิดของตำแหน่งแนวตั้ง ขนาดฟอนต์ของแต่ละบรรทัดคำนวณจากเมทริกซ์การแสดงผลข้อความของตัวเอง และขนาดนั้นถูกเปรียบเทียบกับขนาดบรรทัดมัธยฐานของเอกสารทั้งหมด — ขนาดที่บรรทัดส่วนใหญ่ใช้จริง นั่นคือข้อความเนื้อหาทั่วไป บรรทัดที่ใหญ่กว่าขนาดมัธยฐานนั้นอย่างเห็นได้ชัดจะกลายเป็นหัวข้อ Markdown (บรรทัดที่ใหญ่ที่สุดกลายเป็น #, บรรทัดที่ใหญ่ปานกลางกลายเป็น ##); บรรทัดที่เริ่มต้นด้วยสัญลักษณ์หัวข้อย่อยหรือนั่งย่อหน้าเลยบรรทัดรอบข้างจะกลายเป็นรายการ `- `; อย่างอื่นทั้งหมดถูกปฏิบัติเป็นข้อความเนื้อหาและรวมเป็นย่อหน้า

นี่เป็นหลักการฮิวริสติกอย่างตรงไปตรงมา ไม่ใช่ตัวแยกวิเคราะห์โครงสร้าง: ไฟล์ PDF ไม่มีการมาร์กอัปความหมายที่รับประกัน มีเพียงคำสั่งภาพว่าหมึกอยู่ที่ไหน ดังนั้นการเลือกฟอนต์ที่แปลกของนักออกแบบอาจทำให้การเปรียบเทียบขนาดผิดพลาดได้ในบางครั้ง และตารางอยู่นอกขอบเขตอย่างชัดเจน — เค้าโครงเซลล์ไม่ลดรูปเป็นหัวข้อ รายการ หรือย่อหน้าในทางที่เชื่อถือได้ และเครื่องมือนี้ไม่แสร้งว่าเป็นอย่างอื่น แต่ละหน้าถูกทำเครื่องหมายอย่างชัดเจนด้วยตัวแบ่ง "หน้า N" ในผลลัพธ์ สอดคล้องกับแบบแผนที่ใช้โดยเครื่องมือ PDF เป็นข้อความของเว็บนี้

หน้าที่สแกนมาจะได้รับการปฏิบัติตรงไปตรงมาเหมือนที่อื่นบนเว็บนี้: หน้าที่เป็นเพียงรูปถ่ายกระดาษจริงๆ ไม่มีชั้นข้อความเลย ดังนั้นแทนที่จะให้ส่วนว่างเงียบๆ เครื่องมือจะบันทึกว่าหน้าใดที่อ่านไม่ได้และชี้ไปที่เครื่องมือ รูปภาพเป็นข้อความ (OCR) สำหรับหน้านั้น ทั้งหมดทำงานภายในเบราว์เซอร์ของคุณ — ไม่มีอะไรถูกอัปโหลด ไม่มีการจำกัดจำนวนหน้า และผลลัพธ์จะอยู่ในกล่องข้อความที่คุณสามารถคัดลอกหรือบันทึกเป็นไฟล์ .md ที่เปิดในเอดิเตอร์ที่รู้จัก Markdown