PDF 转 Markdown
将 PDF 中的文字、标题和列表转换为 Markdown —— 在浏览器中运行,无需上传。
将 PDF 中的文字、标题和列表转换为 Markdown —— 在浏览器中运行,无需上传。
需要从 PDF 中提取干净的 Markdown,粘贴到 ChatGPT、Claude 或 RAG 流程中吗?PDFree 会读取您 PDF 中的文字,自动检测标题、项目符号列表、编号列表、粗体/斜体强调、表格、图片和数学公式——然后输出一个纯文本 .md 文件(如果包含图片或公式,则输出附带图片/公式的 .zip)。全部过程都在您的浏览器中运行。您的文档永远不会被上传到任何服务器——包括 PDFree 自己的服务器——如果您喂给 AI 的内容是内部资料、未发布内容,或是其他不想先经过第三方的内容,这一点尤其重要。
本工具会检测文字、标题、列表、表格、图表/图片以及行内/独立数学公式——只要 PDF 中含有可提取的图片或被裁剪的公式,下载结果就会是包含 document.md 和一个图片文件夹的 .zip;否则就是一个纯 .md 文件。如需更可靠的表格提取,请查看 PDF 转 Excel;如需完全可编辑的文档,请查看 PDF 转 Word。最后验证时间:2026 年 8 月。
点击选择文件或将 PDF 拖入拖放区域。PDFree 会立即读取页数。
较大的文字会变成 #/##/### 标题,项目符号和编号行会变成 Markdown 列表语法,粗体/斜体文字也会被保留。
点击转换为 Markdown。一个纯文本 .md 文件会立即下载。
把 PDF 报告或文章以干净、可编辑的 Markdown 形式导入 Obsidian、Logseq 或团队维基,而不是手动复制粘贴带格式的文字。
把 PDF 规格文档、需求文档或导出的设计文档变成 README 或文档页面的初始版本。
Jekyll、Hugo 等静态站点生成器原生支持 Markdown——这样在把 PDF 内容迁移到网站时,就无需手动重新排版。
Markdown 的轻量结构(标题、列表、真正的表格)能给语言模型提供正确的分块边界和阅读顺序——而纯粹的 PDF 文字转储做不到这一点,因为 PDF 存储的是字形位置,而不是文档结构。数学公式在能被正确展平的情况下会保留为行内 $...$ 形式,在无法展平的情况下(如矩阵、堆叠分数)会被裁剪为带标注的图片——因此不会有任何内容悄悄退化成误导性的错误文字。
标题、段落、项目符号列表、编号列表、表格和数学公式都会被自动检测并转换为 Markdown 语法——图表和被裁剪的公式会连同各自的图片一起打包进 .zip,并附带描述性的替代文字。若表格较为复杂,可以尝试 PDF 转 Excel;若需要完全可编辑的文档,可以尝试 PDF 转 Word。
PDF 内部其实没有“段落”或“表格”这样的真实概念——它只是页面上定位好的字形。从 PDF 中提取原始文字,常常会把多栏内容错误地拼接在一起,把脚注混入正文,把表格变成一堆没有对齐的数字。这些对语言模型都没有帮助,而且会实实在在地损害 RAG 流程的检索质量,因为分块边界依赖于源格式本来就不具备的结构信息。
PDFree 的 PDF 转 Markdown 直接从字号、位置和版式中检测出这种结构——真正的 #/## 标题(而不只是变大的字),GitHub 风格的 Markdown 表格(而不是被拍平的行),以及标记为 $...$ 或裁剪为图片(并保留展平后的文字作为替代文字)的数学公式——因此纯文本消费者依然能获得信号,而具备视觉能力的模型也能正确读取图片。全部处理都在本地完成,因此您不想上传给第三方的文档——内部报告、草稿、未发表的研究——不必为了获得适合 AI 使用的格式而离开您的设备。我们在 7 份真实文档上对实际输出质量做了基准测试,与 pymupdf4llm、Docling 和 Marker 对比,得分 91.6/100,与 Docling 仅差 1.1 分。需要在脚本或流水线中使用,而不是浏览器标签页?同一引擎也可以作为 npm CLI/库或自托管的 Docker REST API 运行——同样只在本地处理,不上传,只是换成在您自己的机器上运行。
大多数在线 PDF 转 Markdown 工具会把您的文档上传到远程服务器提取文字,再把文件发回给您。无论 PDF 中是什么——内部笔记、草稿、私人研究——都会短暂地存在于您无法控制的硬件上。
PDFree 的工作方式不同。每一页都在您的浏览器内使用开源库 pdf.js 被读取并结构化为 Markdown——甚至不需要其他任何库,因为 Markdown 本身就是纯文本。您的 PDF 永远不会离开您的设备。没有任何服务器会接收它——甚至 PDFree 自己的服务器也不会。
| 功能 | PDFree | 常见云端工具 |
|---|---|---|
| 数据去向 | 保留在您的设备上 | 上传到远程服务器 |
| 标题和列表检测 | 自动完成 | 效果不一,常常只输出纯文字 |
| 是否需要注册 | 不需要 | 通常需要 |
| 每日使用限制 | 无限制 | 免费版通常受限 |
| 价格 | 永久免费 | 有限制免费 / 付费方案 |
不会。文字的读取和结构化为 Markdown 全部在您的浏览器中使用 pdf.js 完成。您的 PDF 永远不会离开您的设备。
不会。PDFree 完全在您的浏览器中运行——没有接收您文件的后端服务器。由于没有任何内容被上传,也就不可能被存储、记录或保留。您的文档只存在于浏览器内存中,仅在会话期间有效,关闭标签页后即被清除。
表格会被自动检测并转换为 GitHub 风格的 Markdown 表格语法。图片/图表也会被提取出来,数学公式在能被正确展平的情况下标记为 $...$,无法展平时会被裁剪为带标注的图片(并保留展平后的文字作为替代文字)——只要 PDF 中含有可提取的图片或被裁剪的公式,下载结果就会是 .zip(document.md + 图片文件夹);否则就是纯 .md 文件。如需更可靠的表格提取,请使用 PDF 转 Excel;如需完全可编辑的文档,请使用 PDF 转 Word。
不会。这个可选开关会从 Hugging Face 的 CDN 一次性下载一个约 76MB 的 AI 模型(Texo/FormulaNet),以便公式识别能够在您的浏览器中本地运行——这与 PDFree 为 pdf.js 本身所做的一次性库下载性质相同。您的 PDF 永远不会成为该下载的一部分,也永远不会被上传到任何地方;只有模型自身的文件会朝相反方向移动,从 CDN 传输到您的浏览器。该功能默认关闭,且它识别出的每个公式都会被清楚标注为 AI 生成,方便您核对——无法确信识别的公式会回退为原有的图片裁剪方式。
PDFree 会把每一行的字号与文档典型正文字号进行比较。明显更大的文字会变成 Markdown 标题(根据大小程度不同,分别是 #、## 或 ###)。
带项目符号的行(•、◦、▪ 等类似标记)和编号行(“1.”、“2)”)会被转换为 Markdown 列表语法。字母或罗马数字列表(a.、iv.)会保留为纯文字,因为这类标记太容易与正文内容混淆。
是的。PDFree 完全免费——无需注册、无需账号、无需安装。打开工具,加载您的 PDF,然后下载 .md 文件即可。
只有当 PDF 已经带有文字层时才可以。纯图片的扫描版 PDF 没有可提取的文字——请先运行 OCR PDF,再转换结果。
适合。Markdown 能给语言模型提供真正的结构——标题、列表、GitHub 风格的表格——而不是一份扁平的 PDF 文字转储,这既能提高模型理解内容的准确度,也能改善 RAG 流程的分块效果。数学公式会被保留为 $...$ 或带标注的图片,而不是悄悄退化为乱码文字,而且在本地转换意味着文档内容不必为了重新排版而离开您的设备——对于要喂给 ChatGPT、Claude 或您自己的流程的内部或未发表材料尤其有用。表格和公式的检测基于启发式方法,因此异常密集或复杂的版式仍可能丢失一些结构——在用于表格密集或公式密集的文档之前,请检查输出结果。