0

PDF to Markdown コンバーター

PDFのテキストを構造化されたMarkdownとして抽出します。フォントサイズによる実際の見出し検出、行頭文字とインデントによるリスト検出により、平坦なテキストの壁にはしません。

🔒 ブラウザ内で完全に処理されます。ここに入力した内容はアップロードされません。

📑

ここにPDF文書をドラッグ&ドロップ

またはクリックしてPDFファイルを参照

処理中... 0%
PDFを読み込み中
位置情報付きでテキストを抽出中
見出しと構造を検出中
完了

結果

単純な「PDF to テキスト」変換では、単語は得られても文書の構造は失われます。ページタイトルは脚注と同じように読め、箇条書きは連続した文になってしまいます。このツールは一歩進んで、各テキスト要素の実際のフォントサイズと位置をPDFから読み取り、その視覚的な証拠をもとに構造を再構築します。当サイトの他のPDFツールと同じpdf.jsエンジンを用い、見出し、リストアイテム、段落をMarkdownとして書き出します。

この検出は、単なる見せかけの推測ではなく、実際の計測に基づいています。ページ上のテキスト要素は垂直位置の近さによって行にグループ化され、各行のフォントサイズは自身のテキストレンダリングマトリクスから計算されます。そのサイズは文書全体の行サイズ中央値(大部分の行が実際に使っているサイズ、つまり通常の本文サイズ)と比較されます。この中央値より明らかに大きい行はMarkdownの見出しとなり(最も大きい行は#、次に大きい行は##)、行頭文字で始まるか周囲の行より字下げされた行は「- 」のリストアイテムになります。それ以外のものはすべて本文として扱われ、段落に統合されます。

これは正直なところ、構造パーサーではなくヒューリスティックな手法です。PDFファイルには意味的なマークアップは保証されておらず、インクがどこに置かれるかという視覚的な指示しかありません。そのため、デザイナーによる特殊なフォント選択がサイズ比較を狂わせることが時折あります。また、テーブルは明確に対象外です。セルのレイアウトを見出し、リスト、段落のいずれかに確実に還元することはできず、このツールはそれを偽りません。出力には各ページが「Page N」区切りで明示され、これは当サイトのPDF-to-テキストツールで使われている形式に倣っています。

スキャンされたページの扱いも、当サイトの他ツールと同様に正直です。実際には紙の写真に過ぎないページにはテキストレイヤーがまったく存在しません。そのため、何もないセクションを黙って生成する代わりに、読み取れなかったページを正確に示し、それらのページには画像からテキストへ(OCR)ツールの使用を促します。すべての処理はお使いのブラウザ内でローカルに実行されます。ファイルがアップロードされることはなく、ページ数の制限もありません。結果はテキストボックスに表示され、コピーするか、任意のMarkdown対応エディタで開ける.mdファイルとして保存できます。