PDF to Markdown 변환기
PDF의 텍스트를 구조화된 Markdown으로 추출합니다. 글꼴 크기에 기반한 실제 헤딩 감지, 글머리 기호와 들여쓰기로 목록 감지 — 단순히 텍스트만 죽 늘어놓지 않습니다.
🔒 전적으로 귀하의 브라우저에서 처리됩니다. 여기에 입력하는 어떤 것도 업로드되지 않습니다.
결과
단순한 "PDF to text" 결과물은 형태 없이 모든 단어만 제공할 뿐입니다. 페이지 제목이 각주처럼 읽히고, 글머리 목록이 붙어서 한 문장이 되어버립니다. 이 툴은 한 걸음 더 나아가, PDF로부터 각 텍스트 조각의 실제 글꼴 크기와 위치를 읽어들입니다 — 이는 이 사이트의 다른 PDF 툴에서 사용하는 것과 동일한 pdf.js 엔진을 통해서죠 — 그리고 그 시각적 증거를 이용해 헤딩, 목록 항목, 단락으로 이루어진 구조를 Markdown으로 재구성합니다.
감지 방식은 진짜 측정에 기반한 것입니다. 가장하여 추측하는 방식이 아닙니다. 페이지 위의 텍스트 조각들은 수직 위치가 얼마나 가까운지에 따라 줄로 묶이고, 각 줄의 글꼴 크기는 그 줄 자체의 텍스트 렌더링 행렬로부터 계산되며, 그 크기는 문서 전체의 중간 줄 크기, 즉 대부분의 줄이 실제로 사용하는 크기(일반 본문)와 비교됩니다. 그 중간 크기보다 눈에 띄게 큰 줄은 Markdown 헤딩이 되고(가장 큰 줄은 #, 적당히 큰 것은 ##), 글머리 기호로 시작하거나 주변 줄보다 들여쓰기된 줄은 `- ` 목록 항목이 됩니다. 그 외 모든 것은 본문으로 간주되어 단락으로 병합됩니다.
솔직히 말해 이것은 구조적 파서가 아닌 휴리스틱입니다. PDF 파일은 보장된 시맨틱 마크업을 담고 있지 않고, 단지 잉크가 어디에 찍힐지에 대한 시각적 명령만을 담고 있습니다. 따라서 디자이너의 독특한 글꼴 선택이 때때로 크기 비교를 속일 수 있으며, 표는 명시적으로 범위 밖입니다 — 셀 레이아웃은 어떤 믿을 만한 방식으로도 헤딩, 목록, 단락으로 단순화되지 않으며, 이 툴은 그 점을 가장하지 않습니다. 각 페이지는 이 사이트의 PDF-to-text 툴에서 사용하는 방식과 동일하게, 결과물에서 명확히 "Page N" 구분선으로 표시됩니다.
스캔된 페이지는 이 사이트의 다른 곳과 동일하게 솔직하게 처리합니다. 정말로 종이를 찍은 사진에 불과한 페이지에는 텍스트 레이어 자체가 전혀 없기에, 그냥 빈 섹션을 만드는 대신, 툴은 읽을 수 없었던 페이지가 정확히 어느 것인지 표시하고, 그런 페이지들을 위해 Image to Text (OCR) 툴을 안내합니다. 모든 것은 여러분의 브라우저에서 로컬로 실행됩니다 — 업로드되는 것은 없고, 페이지 제한도 없으며, 결과는 텍스트 상자에 나타나 복사하거나 .md 파일로 저장해 Markdown 지원 편집기에서 열 수 있습니다.