0

Trình chuyển đổi PDF sang Markdown

Trích xuất văn bản PDF thành Markdown có cấu trúc: phát hiện tiêu đề thực từ kích thước font, phát hiện danh sách từ dấu đầu dòng và thụt lề — không phải một bức tường văn bản phẳng đơn điệu.

🔒 Được xử lý hoàn toàn trong trình duyệt của bạn — không có nội dung nào bạn nhập ở đây được tải lên.

📑

Kéo & Thả tài liệu PDF tại đây

hoặc Nhấp để duyệt tệp PDF

Đang xử lý... 0%
Đang tải PDF
Đang trích xuất văn bản cùng vị trí
Đang phát hiện tiêu đề và cấu trúc
Xong

Kết quả

Một bản chuyển đổi “PDF sang văn bản” thô cho bạn từng từ mà không giữ được hình dạng: tiêu đề trang đọc giống hệt một chú thích, còn danh sách dấu đầu dòng biến thành một câu dài liên mạch. Công cụ này tiến thêm một bước bằng cách đọc kích thước và vị trí font thực của từng mục văn bản từ PDF — thông qua chính engine pdf.js mà các công cụ PDF khác trên trang này sử dụng — và dùng bằng chứng trực quan đó để tái tạo cấu trúc: tiêu đề, mục danh sách và đoạn văn, được viết ra dưới dạng Markdown.

Phát hiện thực sự dựa trên phép đo, không phải phỏng đoán được tô vẽ. Các mục văn bản trên một trang được nhóm thành dòng theo độ gần nhau về vị trí dọc, kích thước font của mỗi dòng được tính từ ma trận kết xuất văn bản riêng, rồi kích thước đó được so sánh với kích thước dòng trung vị của toàn bộ tài liệu — kích thước mà hầu hết các dòng thực sự dùng, tức là văn bản chính thông thường. Một dòng lớn hơn đáng kể so với trung vị đó trở thành tiêu đề Markdown (dòng lớn nhất thành #, lớn vừa thành ##); một dòng bắt đầu bằng ký tự dấu đầu dòng hoặc nằm thụt lề so với các dòng xung quanh trở thành mục danh sách `- `; mọi thứ khác được coi là văn bản chính và được gộp thành đoạn.

Đây thực sự là một phép suy đoán có chủ đích, không phải trình phân tích cấu trúc: tệp PDF không chứa đánh dấu ngữ nghĩa đảm bảo, chỉ có các hướng dẫn trực quan về vị trí đặt mực, vì vậy lựa chọn font khác thường của nhà thiết kế đôi khi có thể đánh lừa phép so sánh kích thước, còn bảng biểu rõ ràng nằm ngoài phạm vi — bố cục ô không thể quy giản thành tiêu đề, danh sách hay đoạn văn một cách đáng tin cậy, và công cụ này không giả vờ làm được điều đó. Mỗi trang được đánh dấu rõ ràng bằng dòng phân cách “Trang N” trong đầu ra, nhất quán với quy ước của công cụ PDF-sang-văn bản trên trang này.

Các trang quét được xử lý trung thực như các phần khác trên trang này: một trang thực sự chỉ là ảnh chụp giấy sẽ không có lớp văn bản nào, vì vậy thay vì âm thầm tạo ra một phần trống, công cụ sẽ ghi chú chính xác những trang nào không đọc được và chỉ đến công cụ Hình ảnh sang Văn bản (OCR) cho những trang đó. Mọi thứ chạy cục bộ trong trình duyệt của bạn — không có gì được tải lên, không giới hạn số trang, và kết quả hiển thị trong hộp văn bản để bạn sao chép hoặc lưu thành tệp .md mở được trong bất kỳ trình soạn thảo Markdown nào.