OCR 识别 PDF
从扫描版 PDF 中提取文字并使其可被搜索。自动检测文档语言。100% 本地处理——不上传任何内容。
从扫描版 PDF 中提取文字并使其可被搜索。自动检测文档语言。100% 本地处理——不上传任何内容。
从扫描版 PDF 中提取文字、让文档可被搜索、复制内容——直接在您的浏览器中使用 OCR(光学字符识别)完成。无需安装软件,无需账号,您的文件永远不会离开您的设备。
PDFree 会在运行 OCR 之前自动检测您文档的语言,因此您无需猜测——它支持处理数十种语言和文字系统的扫描合同、教科书、发票和档案文件。
拖放文件,或点击“选择 PDF”。PDFree 会自动检测您的 PDF 是已经带有文字层,还是纯粹的扫描图像。
对于扫描版 PDF:点击安装 OCR 引擎以加载 Tesseract.js(约 17 MB,一次性下载)。PDFree 会对页面进行取样,自动推荐文档的语言;如有需要,您也可以从下拉菜单中手动更改。已有文字层的 PDF 会完全跳过此步骤。
文字识别引擎会在本地逐页处理——不会上传任何内容。进度条会显示预计剩余时间。
文字识别完成后,您的 PDF 会自动下载。原始外观不会改变;只是添加了一层不可见的文字层,让您能在任何 PDF 阅读器中搜索、选中和复制文字。
只要您有一份图像格式的文档,需要处理其中的文字,OCR 就能派上用场:
| 使用者 | 典型用途 |
|---|---|
| 法律行业 | 搜索从纸质文件扫描而来的旧合同和法庭文件 |
| 学生 | 从扫描教科书中复制文字、高亮段落、导入笔记 |
| 会计 | 让扫描的发票和收据可搜索,方便审计留痕 |
| 医疗健康 | 在保护文件隐私的同时数字化纸质病历——不会有任何内容离开您的设备 |
| 研究人员 | 让扫描的学术论文和档案文件可被搜索 |
| 政府/人力资源 | 归档纸质表格,并将其转换为可搜索的数字记录 |
PDFree 会自动检测您 PDF 的类型。文字层 PDF(大多数以数字方式创建的 PDF——来自 Word、Google 文档或任何现代应用)本身就在文件中内嵌了机器可读的文字——提取是即时完成的,无需 OCR 引擎。扫描版 PDF(页面照片、传真文档、较旧的档案扫描件、手机扫描导出的文件)只包含图像,需要通过 OCR 把像素转换成可选中、可搜索的文字。
大多数 OCR 工具要求您事先选择文档的语言,一旦选错就会悄悄拉低识别准确率。PDFree 则会对页面内容进行取样并自动推荐正确的语言——这是一个真正独特的功能,因为底层识别引擎的工作与您浏览 PDFree 使用的界面语言完全独立。用英文界面阅读一份俄语、日语或土耳其语的扫描件?语言检测依然能找到文档的真实语言。如果页面混合了多种文字系统或样本不够明确,您随时可以手动覆盖建议结果。
PDFree 使用领先的开源文字识别引擎 Tesseract.js,支持 18 种语言:英语、法语、德语、西班牙语、意大利语、葡萄牙语、俄语、乌兹别克语、荷兰语、波兰语、土耳其语(欧洲文字)以及阿拉伯语、日语、简体中文、繁体中文、韩语、印地语、泰语(复杂文字系统)。
OCR 完成后,PDFree 会根据 Tesseract 的单词置信度显示质量评分(优秀 / 良好 / 一般 / 较差)。主要影响因素包括:
可搜索 PDF 会完全保留您原始的扫描图像,并在其上添加一层不可见的文字层。用任何 PDF 阅读器打开它,您都可以选中文字、用 Ctrl+F 搜索、复制内容——视觉外观不会改变。适合归档、分享或长期存储。
.txt 文件 只包含提取出的纯文字,并带有分页符。当您需要在 Word 或 Google 文档中编辑内容、将文字提供给其他工具,或以编程方式处理时,可以使用它。在选项中启用“同时下载 .txt 副本”即可一次获得两个文件。
扫描文档常常包含敏感内容——合同、医疗记录、私人信件、税务表格。使用 PDFree,任何内容都不会被上传。OCR 引擎(Tesseract.js)只需下载一次,随后完全在您的浏览器标签页内运行。没有任何服务器接收您的文件,没有云存储,也没有任何形式的数据收集。处理过程中打开开发者工具 → Network 标签页即可自行验证:零文件上传。
首次运行 OCR 时下载 Tesseract.js 引擎后(约 17 MB,由浏览器缓存),PDFree OCR 便可完全离线运行。处理后续文档不再需要网络连接。这使它适用于网络受限的环境——律师事务所、医疗机构、涉密文件审查,或任何不能将文件发送到外部服务器的场合。Service Worker 会缓存应用外壳,因此首次访问后即使界面本身也能离线加载。
| 功能 | PDFree | 常见在线 OCR |
|---|---|---|
| 文件处理方式 | 在您的浏览器中——仅本地处理 | 文件上传到服务器 |
| 语言选择 | 从文档中自动检测 | 手动选择,容易选错 |
| 是否需要账号 | 不需要 | 通常需要 |
| 输出格式 | 可搜索 PDF + 可选 .txt | 许多工具仅支持 .txt |
| 原始版式 | 精确保留 | 常常被重新排版 |
| 是否支持离线使用 | 支持,首次加载后即可 | 不支持 |
要把扫描版 PDF 转换为可编辑文字,可以分两步使用 PDFree:先运行 OCR 生成可搜索的 PDF(见上文),再把结果放入 PDF 转 Word——该工具会把内嵌的文字层转换为完全可编辑的 .docx 文件。整个过程都在本地完成;您的文档不会被上传到任何地方。如需纯文本输出,可以在 OCR 时勾选“同时下载 .txt 副本”,完全跳过转换为 Word 的步骤。
是的,完全免费。无需订阅,没有高级版,不按文件收费。OCR 引擎(Tesseract.js)是开源的,完全在您的浏览器中运行。
不会。PDFree 没有接收您文件的后端服务器,因此没有任何内容能被存储、记录或保留。您的 PDF 和识别出的文字只存在于浏览器内存中,仅在会话期间有效,关闭标签页后即被清除。
绝不会。所有处理都在您的浏览器标签页内进行。您的 PDF 文件永远不会离开您的设备——没有任何服务器会接收它。Tesseract.js 引擎只需从 CDN 下载一次并缓存;之后即可完全离线运行。
在运行 OCR 之前,PDFree 会从您的扫描页面中取样文字,并推荐最有可能的文档语言——您无需事先知道它。这与站点界面语言完全独立地工作,因此即使您使用英文浏览 PDFree,西班牙语扫描件也能被正确检测。您随时可以从下拉菜单中手动覆盖建议结果。
18 种语言:英语、法语、德语、西班牙语、意大利语、葡萄牙语、俄语、乌兹别克语、荷兰语、波兰语、土耳其语、阿拉伯语、日语、简体中文、繁体中文、韩语、印地语和泰语。
不会。PDFree 只是在您原始的扫描页面上添加一层不可见的文字层。外观不会改变——图像、版式和格式都会保持原样。您获得的是在任何 PDF 阅读器中搜索、选中和复制文字的能力。
OCR 准确率取决于原始扫描质量。低分辨率(低于 150 DPI)、模糊或倾斜的页面、彩色背景以及手写文字都会降低置信度评分。为获得最佳效果:请以 300 DPI 或更高分辨率扫描,保证光线充足、页面对齐平整,并让自动检测选择(或确认)正确的语言。
可搜索 PDF 保留您原始的扫描图像,并在其上添加一层不可见的文字层——适合归档、在 PDF 阅读器内搜索或分享。.txt 文件只包含提取出的纯文字,并带有分页符——适合在 Word 中编辑、导入其他工具或复制内容。勾选“同时下载 .txt 副本”即可一次获得两个文件。
PDFree OCR 支持最大 200 MB 的文件。在移动端(iOS/iPadOS),处理会限制在前 30 页以防止内存问题——请先拆分 PDF 以处理剩余部分。桌面浏览器没有此限制。
可以。首次运行 OCR 下载 Tesseract.js 引擎后,PDFree 就能作为渐进式网页应用(PWA)完全离线运行——处理后续文档不再需要网络连接。