PDFからマークダウンへのコンバーター
PDF のテキストを構造化マークダウンとして抽出します。テキストの 1 つの平らな壁ではなく、フォント サイズから実際の見出しを検出し、箇条書きとインデントからリストを検出します。
結果
プレーンな「PDF からテキスト」ダンプでは、形のないすべての単語が得られます。ページ タイトルは脚注のように正確に読み取れ、箇条書きリストは続きの文に変わります。このツールはさらに一歩進んで、PDF から各テキスト項目の実際のフォント サイズと位置を読み取り (このサイトの他の PDF ツールが使用しているのと同じ pdf.js エンジンを介して)、その視覚的証拠を使用して構造 (見出し、リスト項目、段落) を再構築し、Markdown として書き出します。
検出は純粋に測定に基づいており、推測を装ったものではありません。ページ上のテキスト項目は、垂直位置の近さによって行にグループ化され、各行のフォント サイズは独自のテキスト レンダリング マトリックスから計算され、そのサイズがドキュメント全体の行サイズの中央値 (ほとんどの行、つまり通常の本文テキストで実際に使用されるサイズ) と比較されます。その中央値よりも著しく大きい行はマークダウンの見出しになります (最大の行は # になり、適度に大きい行は ## になります)。黒丸文字で始まる行、または周囲の行を超えてインデントされた行は、「-」リスト項目になります。それ以外はすべて本文として扱われ、段落に結合されます。
正直なところ、これはヒューリスティックであり、構造パーサーではありません。PDF ファイルには保証されたセマンティック マークアップはなく、インクがどこに行くのかについての視覚的な指示のみが含まれているため、デザイナーの異常なフォント選択によってサイズ比較が誤魔化される場合があり、表は明示的に範囲外です。セル レイアウトは信頼できる方法で見出し、リスト、または段落に縮小されることはなく、このツールはそうではないふりをしません。出力では各ページに「ページ N」の区切り線が明確にマークされており、このサイトの PDF テキスト変換ツールで使用されている規則と一致しています。
スキャンされたページは、このサイトの他の場所と同様に誠実に扱われます。実際には単なる紙の写真であるページには、テキスト レイヤーがまったくありません。そのため、このツールは、何も言わずに空のセクションを作成するのではなく、どのページが読み取れなかったかを正確に記録し、それらのページに対して Image to Text (OCR) ツールを示します。すべてがブラウザ内でローカルに実行されます。何もアップロードされず、ページ制限もありません。結果はテキスト ボックスに表示され、Markdown 対応エディタで開く .md ファイルとしてコピーまたは保存できます。