0

โปรแกรมแปลงไฟล์ PDF เป็น Markdown

แยกข้อความของ PDF ออกเป็น Markdown ที่มีโครงสร้าง: การตรวจจับส่วนหัวจริงจากขนาดตัวอักษร การตรวจจับรายการจากสัญลักษณ์แสดงหัวข้อย่อยและการเยื้อง - ไม่ใช่ผนังข้อความเรียบๆ

📑

ลากและวางเอกสาร PDF ที่นี่

หรือคลิกเพื่อเรียกดูไฟล์ PDF

Buy Me a Coffee at ko-fi.com
กำลังประมวลผล... 0%
กำลังโหลด PDF
แยกข้อความที่มีตำแหน่ง
การตรวจจับส่วนหัวและโครงสร้าง
เสร็จแล้ว

ผลลัพธ์

ไฟล์ดัมพ์ "PDF เป็นข้อความ" ธรรมดาช่วยให้คุณได้ทุกคำโดยไม่มีรูปร่าง: ชื่อหน้าอ่านได้เหมือนกับเชิงอรรถทุกประการ และรายการสัญลักษณ์แสดงหัวข้อย่อยจะกลายเป็นประโยคต่อเนื่อง เครื่องมือนี้ก้าวไปอีกขั้นด้วยการอ่านขนาดตัวอักษรและตำแหน่งที่แท้จริงของรายการข้อความจาก PDF ผ่านกลไก pdf.js เดียวกับที่เครื่องมือ PDF อื่น ๆ ของไซต์นี้ใช้ และใช้หลักฐานที่มองเห็นนั้นเพื่อสร้างโครงสร้างใหม่: ส่วนหัว รายการ และย่อหน้า เขียนเป็น Markdown

การตรวจจับนั้นอิงจากการวัดอย่างแท้จริง ไม่ใช่การคาดเดาที่แต่งตัวเป็นหนึ่งเดียว รายการข้อความบนเพจจะถูกจัดกลุ่มเป็นบรรทัดตามระยะห่างของตำแหน่งในแนวตั้ง ขนาดแบบอักษรของแต่ละบรรทัดจะคำนวณจากเมทริกซ์การแสดงข้อความของตัวเอง และขนาดนั้นจะถูกเปรียบเทียบกับขนาดเส้นมัธยฐานของทั้งเอกสาร ซึ่งเป็นขนาดที่บรรทัดส่วนใหญ่ใช้จริง เช่น ข้อความเนื้อหาธรรมดา เส้นที่มีขนาดใหญ่กว่าค่ามัธยฐานอย่างเห็นได้ชัดจะกลายเป็นส่วนหัวของ Markdown (เส้นที่ใหญ่ที่สุดกลายเป็น # เส้นที่ใหญ่กว่าพอสมควรจะกลายเป็น ##) บรรทัดที่ขึ้นต้นด้วยสัญลักษณ์แสดงหัวข้อย่อยหรือเยื้องผ่านบรรทัดโดยรอบจะกลายเป็นรายการ `- ` ทุกสิ่งทุกอย่างจะถือเป็นข้อความเนื้อหาและผสานเป็นย่อหน้า

นี่เป็นฮิวริสติกโดยสุจริต ไม่ใช่ตัวแยกวิเคราะห์โครงสร้าง ไฟล์ PDF ไม่มีมาร์กอัปเชิงความหมายที่รับประกัน มีเพียงคำแนะนำแบบภาพว่าหมึกไปอยู่ที่ไหน ดังนั้นตัวเลือกแบบอักษรที่ผิดปกติของนักออกแบบจึงอาจหลอกการเปรียบเทียบขนาดได้เป็นครั้งคราว และตารางอยู่นอกขอบเขตอย่างชัดเจน เลย์เอาต์ของเซลล์จะไม่ลดเหลือส่วนหัว รายการ หรือย่อหน้าด้วยวิธีที่เชื่อถือได้ใดๆ และเครื่องมือนี้ไม่ได้เสแสร้งเป็นอย่างอื่น แต่ละหน้ามีการทำเครื่องหมายอย่างชัดเจนด้วยตัวแบ่ง "Page N" ในเอาต์พุต ซึ่งตรงกับแบบแผนที่ใช้โดยเครื่องมือ PDF เป็นข้อความของไซต์นี้

หน้าที่สแกนจะได้รับการปฏิบัติอย่างตรงไปตรงมาเช่นเดียวกับหน้าอื่นๆ บนไซต์นี้ หน้าที่เป็นเพียงรูปถ่ายกระดาษจริงๆ ไม่มีเลเยอร์ข้อความเลย ดังนั้นแทนที่จะสร้างส่วนที่ว่างอย่างเงียบๆ เครื่องมือจะบันทึกอย่างชัดเจนว่าหน้าใดที่ไม่สามารถอ่านได้ และชี้ไปที่เครื่องมือ Image to Text (OCR) สำหรับหน้าเหล่านั้น ทุกอย่างทำงานภายในเบราว์เซอร์ของคุณ ไม่มีการอัปโหลด ไม่มีการจำกัดหน้า และผลลัพธ์จะอยู่ในกล่องข้อความที่คุณสามารถคัดลอกหรือบันทึกเป็นไฟล์ .md ที่เปิดในตัวแก้ไข Markdown-aware ใดก็ได้