0

PDF 到 Markdown 转换器

将 PDF 文本提取为结构化 Markdown:根据字体大小进行真实标题检测,根据项目符号和缩进进行列表检测,而不是一堵平坦的文本墙。

📑

将 PDF 文档拖放到此处

或点击浏览PDF文件

Buy Me a Coffee at ko-fi.com
处理中... 0%
加载 PDF
提取带有位置的文本
检测标题和结构
完成

结果

简单的“PDF 到文本”转储会为您提供没有任何形状的每个单词:页面标题读起来就像脚注一样,项目符号列表变成连续的句子。该工具更进一步,通过该网站其他 PDF 工具使用的相同 pdf.js 引擎,从 PDF 中读取每个文本项的真实字体大小和位置,并使用该视觉证据来重建结构:标题、列表项和段落,以 Markdown 形式编写。

该检测是真正基于测量的,而不是伪装的猜测。页面上的文本项根据其垂直位置的接近程度分为行,每行的字体大小是根据其自己的文本渲染矩阵计算的,并将该大小与整个文档的中线大小进行比较 - 大多数行实际使用的大小,即普通正文文本。明显大于中位数的行成为 Markdown 标题(最大的行成为 #,稍大的行成为 ##);以项目符号字符开头或缩进超过周围行的行成为“-”列表项;其他所有内容都被视为正文并合并到段落中。

这实际上是一个启发式的,而不是一个结构解析器:PDF 文件没有保证语义标记,只有墨水去向的视觉指示,因此设计者不寻常的字体选择有时会欺骗大小比较,并且表格明确超出范围 - 单元格布局不会以任何可靠的方式简化为标题、列表或段落,并且该工具不会假装不是这样。每个页面在输出中都清楚地标有“第 N 页”分隔线,与该网站的 PDF 转文本工具使用的约定相匹配。

扫描的页面得到与本网站其他地方相同的诚实对待:实际上只是纸质照片的页面根本没有文本层,因此该工具不会默默地生成一个空白部分,而是准确记录它无法读取的页面,并指向这些页面的图像到文本 (OCR) 工具。一切都在您的浏览器本地运行 - 没有任何内容上传,没有页面限制,结果会出现在一个文本框中,您可以复制或另存为 .md 文件,该文件可以在任何支持 Markdown 的编辑器中打开。