PDF からテキストへのコンバーター
ブラウザで PDF のテキスト レイヤーからプレーン テキストをページごとに抽出し、コピーまたはダウンロードできるようにします。
結果
PDF は読みやすいですが、再利用するのが面倒です。テキストを常にきれいに選択できるとは限らず、手作業でページごとにコピーするのは面倒です。このツールは、ブラウザ内で 1 回のパスで PDF のテキスト レイヤーからプレーン テキストを抽出し、コピーまたはダウンロードできる状態で返します。アップロードやアカウント、透かしは必要ありません。
抽出はページごとに行われます。各ページのテキストはドキュメント自体のテキスト レイヤーから取得され、明確な「ページ N」マーカーで区切られているため、50 ページのレポートが 1 つの未分化な単語の壁に崩れることなく、整理された状態を保ちます。結果はテキスト ボックスに表示され、読み取り、選択、クリップボードへのコピー、またはどこでも開く .txt ファイルとして保存できます。
ここでは正直さが重要です。多くの PDF はスキャンされたもので、テキスト レイヤーがまったくない紙の写真です。その場合、いくら抽出しても単語は見つからないため、何も言わずに空のファイルを返すのではなく、ツールは空の結果を検出して文書がスキャンであることを通知し、実際にピクセルを読み取ることができる Image to Text (OCR) ツールを指示します。これはテキスト抽出ツールであり、OCR エンジンではありません。また、PDF を編集可能な Word 文書に変換するわけではありません。
プロセス全体は pdf.js エンジンを通じて自分のマシン上で実行されるため、機密の契約書、明細書、記録がデバイスから流出することはありません。ページ制限やサーバーの往復はありません。ページをテキストではなく画像として必要な場合、PDF-to-JPG ツールは代わりに各ページを画像にレンダリングします。