OCR 识别 PDF

从扫描版 PDF 中提取文字并使其可被搜索。自动检测文档语言。100% 本地处理——不上传任何内容。

✓ 无文件大小限制 ✓ 无需注册账号 ✓ 不添加水印 ✓ 永久免费
将文件拖放到此处
或点击浏览 — 文件数量不限
您的文件永不离开浏览器 — 本地处理,无需上传

免费 OCR 识别 PDF —— 让扫描版 PDF 可被搜索

从扫描版 PDF 中提取文字、让文档可被搜索、复制内容——直接在您的浏览器中使用 OCR(光学字符识别)完成。无需安装软件,无需账号,您的文件永远不会离开您的设备

PDFree 会在运行 OCR 之前自动检测您文档的语言,因此您无需猜测——它支持处理数十种语言和文字系统的扫描合同、教科书、发票和档案文件。

什么是 OCR? OCR(光学字符识别)能把一份图像 PDF——即每一页都是照片的扫描文档——转换为可搜索的 PDF,方法是在原始图像上叠加一层不可见的文字层。PDFree 使用 Tesseract.js 完全在您的浏览器中运行 OCR;您的文件不会被上传到任何服务器。文档的原始外观会被精确保留。

如何让扫描版 PDF 可被搜索

1
打开您的扫描版 PDF

拖放文件,或点击“选择 PDF”。PDFree 会自动检测您的 PDF 是已经带有文字层,还是纯粹的扫描图像。

2
让 PDFree 检测语言,或自己选择

对于扫描版 PDF:点击安装 OCR 引擎以加载 Tesseract.js(约 17 MB,一次性下载)。PDFree 会对页面进行取样,自动推荐文档的语言;如有需要,您也可以从下拉菜单中手动更改。已有文字层的 PDF 会完全跳过此步骤。

3
点击“让 PDF 可搜索”

文字识别引擎会在本地逐页处理——不会上传任何内容。进度条会显示预计剩余时间。

4
下载可搜索的 PDF

文字识别完成后,您的 PDF 会自动下载。原始外观不会改变;只是添加了一层不可见的文字层,让您能在任何 PDF 阅读器中搜索、选中和复制文字。

什么时候需要用 OCR

只要您有一份图像格式的文档,需要处理其中的文字,OCR 就能派上用场:

使用者 典型用途
法律行业 搜索从纸质文件扫描而来的旧合同和法庭文件
学生 从扫描教科书中复制文字、高亮段落、导入笔记
会计 让扫描的发票和收据可搜索,方便审计留痕
医疗健康 在保护文件隐私的同时数字化纸质病历——不会有任何内容离开您的设备
研究人员 让扫描的学术论文和档案文件可被搜索
政府/人力资源 归档纸质表格,并将其转换为可搜索的数字记录

文字版 PDF 与扫描版 PDF —— 区别是什么?

PDFree 会自动检测您 PDF 的类型。文字层 PDF(大多数以数字方式创建的 PDF——来自 Word、Google 文档或任何现代应用)本身就在文件中内嵌了机器可读的文字——提取是即时完成的,无需 OCR 引擎。扫描版 PDF(页面照片、传真文档、较旧的档案扫描件、手机扫描导出的文件)只包含图像,需要通过 OCR 把像素转换成可选中、可搜索的文字。

自动语言检测 —— 无需猜测

大多数 OCR 工具要求您事先选择文档的语言,一旦选错就会悄悄拉低识别准确率。PDFree 则会对页面内容进行取样并自动推荐正确的语言——这是一个真正独特的功能,因为底层识别引擎的工作与您浏览 PDFree 使用的界面语言完全独立。用英文界面阅读一份俄语、日语或土耳其语的扫描件?语言检测依然能找到文档的真实语言。如果页面混合了多种文字系统或样本不够明确,您随时可以手动覆盖建议结果。

支持 18 种语言

PDFree 使用领先的开源文字识别引擎 Tesseract.js,支持 18 种语言:英语、法语、德语、西班牙语、意大利语、葡萄牙语、俄语、乌兹别克语、荷兰语、波兰语、土耳其语(欧洲文字)以及阿拉伯语、日语、简体中文、繁体中文、韩语、印地语、泰语(复杂文字系统)。

哪些因素会影响 OCR 质量?

OCR 完成后,PDFree 会根据 Tesseract 的单词置信度显示质量评分(优秀 / 良好 / 一般 / 较差)。主要影响因素包括:

  • 扫描分辨率——300 DPI 或更高能获得最佳效果。低于 150 DPI 时,细笔画和小字会变得难以识别。
  • 页面对齐——倾斜或旋转的页面会降低识别准确率。PDFree 会自动修正 PDF 旋转(90°/180°/270°),但扫描件本身的物理倾斜无法修正。
  • 印刷体与手写体——印刷文字识别效果良好;Tesseract 不支持手写连笔字。
  • 背景噪点——彩色背景、阴影或水印会降低对比度。PDFree 会在 OCR 前将页面转换为灰度以提升识别效果。
  • 语言匹配——自动检测在大多数情况下都能为您选对模型;对于多语言混合的文档,建议手动选择主要语言以获得最佳效果。

可搜索 PDF 与纯文本 —— 该下载哪个?

可搜索 PDF 会完全保留您原始的扫描图像,并在其上添加一层不可见的文字层。用任何 PDF 阅读器打开它,您都可以选中文字、用 Ctrl+F 搜索、复制内容——视觉外观不会改变。适合归档、分享或长期存储。

.txt 文件 只包含提取出的纯文字,并带有分页符。当您需要在 Word 或 Google 文档中编辑内容、将文字提供给其他工具,或以编程方式处理时,可以使用它。在选项中启用“同时下载 .txt 副本”即可一次获得两个文件。

隐私 —— 您的扫描文档保持私密

扫描文档常常包含敏感内容——合同、医疗记录、私人信件、税务表格。使用 PDFree,任何内容都不会被上传。OCR 引擎(Tesseract.js)只需下载一次,随后完全在您的浏览器标签页内运行。没有任何服务器接收您的文件,没有云存储,也没有任何形式的数据收集。处理过程中打开开发者工具 → Network 标签页即可自行验证:零文件上传。

离线使用 PDFree OCR

首次运行 OCR 时下载 Tesseract.js 引擎后(约 17 MB,由浏览器缓存),PDFree OCR 便可完全离线运行。处理后续文档不再需要网络连接。这使它适用于网络受限的环境——律师事务所、医疗机构、涉密文件审查,或任何不能将文件发送到外部服务器的场合。Service Worker 会缓存应用外壳,因此首次访问后即使界面本身也能离线加载。

PDFree OCR 与常见在线 OCR 工具的对比

功能 PDFree 常见在线 OCR
文件处理方式 在您的浏览器中——仅本地处理 文件上传到服务器
语言选择 从文档中自动检测 手动选择,容易选错
是否需要账号 不需要 通常需要
输出格式 可搜索 PDF + 可选 .txt 许多工具仅支持 .txt
原始版式 精确保留 常常被重新排版
是否支持离线使用 支持,首次加载后即可 不支持

如何把扫描版 PDF 转换为可编辑文字

要把扫描版 PDF 转换为可编辑文字,可以分两步使用 PDFree:先运行 OCR 生成可搜索的 PDF(见上文),再把结果放入 PDF 转 Word——该工具会把内嵌的文字层转换为完全可编辑的 .docx 文件。整个过程都在本地完成;您的文档不会被上传到任何地方。如需纯文本输出,可以在 OCR 时勾选“同时下载 .txt 副本”,完全跳过转换为 Word 的步骤。

常见问题

这个 OCR 工具真的免费吗?

是的,完全免费。无需订阅,没有高级版,不按文件收费。OCR 引擎(Tesseract.js)是开源的,完全在您的浏览器中运行。

PDFree 会在处理后存储或记录我的文件吗?

不会。PDFree 没有接收您文件的后端服务器,因此没有任何内容能被存储、记录或保留。您的 PDF 和识别出的文字只存在于浏览器内存中,仅在会话期间有效,关闭标签页后即被清除。

我的文件会被上传到服务器吗?

绝不会。所有处理都在您的浏览器标签页内进行。您的 PDF 文件永远不会离开您的设备——没有任何服务器会接收它。Tesseract.js 引擎只需从 CDN 下载一次并缓存;之后即可完全离线运行。

自动语言检测是如何工作的?

在运行 OCR 之前,PDFree 会从您的扫描页面中取样文字,并推荐最有可能的文档语言——您无需事先知道它。这与站点界面语言完全独立地工作,因此即使您使用英文浏览 PDFree,西班牙语扫描件也能被正确检测。您随时可以从下拉菜单中手动覆盖建议结果。

支持哪些语言?

18 种语言:英语、法语、德语、西班牙语、意大利语、葡萄牙语、俄语、乌兹别克语、荷兰语、波兰语、土耳其语、阿拉伯语、日语、简体中文、繁体中文、韩语、印地语和泰语。

OCR 后 PDF 的外观会改变吗?

不会。PDFree 只是在您原始的扫描页面上添加一层不可见的文字层。外观不会改变——图像、版式和格式都会保持原样。您获得的是在任何 PDF 阅读器中搜索、选中和复制文字的能力。

为什么我的 OCR 质量评分是“较差”或“一般”?

OCR 准确率取决于原始扫描质量。低分辨率(低于 150 DPI)、模糊或倾斜的页面、彩色背景以及手写文字都会降低置信度评分。为获得最佳效果:请以 300 DPI 或更高分辨率扫描,保证光线充足、页面对齐平整,并让自动检测选择(或确认)正确的语言。

可搜索 PDF 和 .txt 文件有什么区别?

可搜索 PDF 保留您原始的扫描图像,并在其上添加一层不可见的文字层——适合归档、在 PDF 阅读器内搜索或分享。.txt 文件只包含提取出的纯文字,并带有分页符——适合在 Word 中编辑、导入其他工具或复制内容。勾选“同时下载 .txt 副本”即可一次获得两个文件。

文件大小限制是多少?

PDFree OCR 支持最大 200 MB 的文件。在移动端(iOS/iPadOS),处理会限制在前 30 页以防止内存问题——请先拆分 PDF 以处理剩余部分。桌面浏览器没有此限制。

能离线使用吗?

可以。首次运行 OCR 下载 Tesseract.js 引擎后,PDFree 就能作为渐进式网页应用(PWA)完全离线运行——处理后续文档不再需要网络连接。

相关工具

为什么选择 PDFree 而不是其他 PDF 工具?

📁
无文件大小限制 合并、压缩或转换任意大小的 PDF 文件 — 500 MB、1 GB 均无限制。
🔒
文件永不离开您的设备 一切都在您的浏览器中运行。无需上传,没有服务器,不会泄露数据 — 离线也能使用。
👤
无需注册账号 无需注册,无需邮箱,无需登录。打开页面即可使用工具 — 就是这么简单。
🚫
不添加水印 输出文件干净整洁。没有品牌标识,没有水印图章,没有隐藏文本层。
♾️
无每日次数限制 可根据需要多次使用。没有每日配额,没有每月上限,没有付费升级推销。
🆓
永久免费 没有免费试用期,没有增值付费层级。PDFree 完全免费 — 基于 AGPLv3 协议开源。