Công cụ chuyển đổi PDF sang Markdown
Trích xuất văn bản PDF dưới dạng Markdown có cấu trúc: phát hiện tiêu đề thực từ kích thước phông chữ, phát hiện danh sách từ dấu đầu dòng và thụt lề - không phải một bức tường văn bản phẳng.
kết quả
Kết xuất "PDF sang văn bản" đơn giản cung cấp cho bạn mọi từ không có hình dạng: tiêu đề trang đọc chính xác như chú thích cuối trang và danh sách có dấu đầu dòng chuyển thành câu chạy tiếp. Công cụ này tiến thêm một bước nữa bằng cách đọc kích thước và vị trí phông chữ thực của từng mục văn bản từ PDF — thông qua cùng một công cụ pdf.js mà các công cụ PDF khác của trang web này sử dụng — và sử dụng bằng chứng trực quan đó để tái tạo lại cấu trúc: tiêu đề, danh sách mục và đoạn văn, được viết dưới dạng Markdown.
Việc phát hiện thực sự dựa trên phép đo chứ không phải là phỏng đoán được ngụy trang như một phép đo. Các mục văn bản trên một trang được nhóm thành các dòng theo vị trí dọc của chúng, kích thước phông chữ của mỗi dòng được tính toán từ ma trận hiển thị văn bản của chính nó và kích thước đó được so sánh với kích thước dòng trung bình cho toàn bộ tài liệu — kích thước mà hầu hết các dòng thực sự sử dụng, tức là văn bản nội dung thông thường. Một dòng lớn hơn đáng kể so với mức trung bình đó sẽ trở thành tiêu đề Markdown (các dòng lớn nhất trở thành #, các dòng lớn hơn vừa phải trở thành ##); một dòng bắt đầu bằng ký tự dấu đầu dòng hoặc nằm thụt lề qua các dòng xung quanh sẽ trở thành một mục danh sách `- `; mọi thứ khác được coi là văn bản nội dung và được hợp nhất thành các đoạn văn.
Đây thực sự là một phương pháp heuristic, không phải là một trình phân tích cú pháp cấu trúc: các tệp PDF không có đánh dấu ngữ nghĩa được đảm bảo, chỉ có các hướng dẫn trực quan về vị trí mực đi, do đó, các lựa chọn phông chữ bất thường của nhà thiết kế đôi khi có thể đánh lừa việc so sánh kích thước và các bảng rõ ràng nằm ngoài phạm vi — bố cục ô không giảm xuống các tiêu đề, danh sách hoặc đoạn văn theo bất kỳ cách đáng tin cậy nào và công cụ này không giả vờ khác đi. Mỗi trang được đánh dấu rõ ràng bằng vạch chia "Trang N" ở đầu ra, phù hợp với quy ước được sử dụng bởi công cụ chuyển PDF sang văn bản của trang web này.
Các trang được quét được xử lý trung thực giống như những nơi khác trên trang web này: một trang thực sự chỉ là một bức ảnh trên giấy không có lớp văn bản nào cả, do đó, thay vì âm thầm tạo ra một phần trống, công cụ sẽ ghi chú chính xác những trang mà nó không thể đọc và trỏ đến công cụ Hình ảnh thành Văn bản (OCR) cho những trang đó. Mọi thứ đều chạy cục bộ trong trình duyệt của bạn — không có gì được tải lên, không có giới hạn trang và kết quả nằm trong hộp văn bản mà bạn có thể sao chép hoặc lưu dưới dạng tệp .md mở trong bất kỳ trình chỉnh sửa nhận biết Markdown nào.