0

PDF를 마크다운으로 변환하는 변환기

PDF의 텍스트를 구조화된 마크다운으로 추출합니다. 단 하나의 텍스트 벽이 아닌 글꼴 크기에서 실제 제목 감지, 글머리 기호 및 들여쓰기에서 목록 감지가 가능합니다.

📑

PDF 문서를 여기에 드래그 앤 드롭하세요.

또는 PDF 파일을 찾아보려면 클릭하세요.

Buy Me a Coffee at ko-fi.com
처리 중... 0%
PDF 로드 중
위치를 사용하여 텍스트 추출
제목 및 구조 감지
완료

결과

일반 "PDF를 텍스트로" 덤프하면 모양이 전혀 없는 모든 단어가 제공됩니다. 페이지 제목은 각주와 똑같이 읽히고 글머리 기호 목록은 연속 문장으로 변합니다. 이 도구는 한 단계 더 나아가 PDF에서 각 텍스트 항목의 실제 글꼴 크기와 위치를 읽고(이 사이트의 다른 PDF 도구에서 사용하는 것과 동일한 pdf.js 엔진을 통해) 해당 시각적 증거를 사용하여 Markdown으로 작성된 제목, 목록 항목 및 단락과 같은 구조를 재구성합니다.

탐지는 추측을 가장한 것이 아니라 진정한 측정 기반입니다. 페이지의 텍스트 항목은 세로 위치가 얼마나 가까운지에 따라 줄로 그룹화되고, 각 줄의 글꼴 크기는 자체 텍스트 렌더링 매트릭스에서 계산되며, 해당 크기는 전체 문서의 중간 줄 크기(대부분의 줄이 실제로 사용하는 크기, 즉 일반 본문 텍스트)와 비교됩니다. 해당 중앙값보다 눈에 띄게 큰 줄은 Markdown 제목이 됩니다(가장 큰 줄은 #이 되고, 적당히 큰 줄은 ##이 됩니다). 글머리 기호 문자로 시작하거나 주변 줄을 지나 들여쓰기된 줄은 `- ` 목록 항목이 됩니다. 다른 모든 내용은 본문 텍스트로 처리되어 단락으로 병합됩니다.

이것은 솔직히 구조적 파서가 아닌 경험적 분석입니다. PDF 파일에는 보장된 의미 마크업이 없고 잉크가 이동하는 위치에 대한 시각적 지침만 있으므로 디자이너의 비정상적인 글꼴 선택으로 인해 크기 비교가 때때로 실패할 수 있으며 테이블은 명시적으로 범위를 벗어납니다. 셀 레이아웃은 신뢰할 수 있는 방식으로 제목, 목록 또는 단락으로 축소되지 않으며 이 도구는 그렇지 않은 척하지 않습니다. 각 페이지는 출력에 "페이지 N" 구분선으로 명확하게 표시되어 있으며 이 사이트의 PDF-텍스트 도구에서 사용되는 규칙과 일치합니다.

스캔한 페이지는 이 사이트의 다른 곳과 동일하게 정직하게 처리됩니다. 실제로 종이 사진인 페이지에는 텍스트 레이어가 전혀 없습니다. 따라서 빈 섹션을 자동으로 생성하는 대신 도구는 읽을 수 없는 페이지를 정확히 기록하고 해당 페이지에 대해 이미지를 텍스트로(OCR) 도구를 가리킵니다. 모든 것이 브라우저에서 로컬로 실행됩니다. 아무것도 업로드되지 않고 페이지 제한도 없으며 결과는 Markdown 인식 편집기에서 열리는 .md 파일로 복사하거나 저장할 수 있는 텍스트 상자에 표시됩니다.