OCR PDF:生成可搜索的 PDF
把扫描的家庭文件变成带可选中文本的 PDF,方便以后搜索和复制;支持简体中文、英语、西班牙语和俄语,最多 10 页。 文件保留在浏览器中。
识别文件首次使用时约 26 MB,另加语言数据。
识别出的文本
这个工具有用吗?
试试示例
下载示例文件语言选择“简体中文”。下载 PDF 后搜索“发票”、148.50、“发货”和 2048。两页外观应与示例一致,文本可以选中并复制。
预期结果
每页按顺序作为图片识别。提供英语、俄语和混合识别。OCR 可能误读字母、数字、列和表格:请检查结果。 将根据渲染的页面图片和不可见的文本层创建新的 PDF。保留可见的页面大小和旋转;不保留表单、链接、书签、附件和数字签名。已有文本会重新识别;图片质量受渲染分辨率限制。
每页渲染最多 4 百万像素。加载和每个处理步骤最长 90 秒;整个任务在 10 分钟后停止。空白页会在文本中标出。处理失败或未识别到文本时,不提供下载。
受保护的 PDF?请先用密码解锁。
首次运行可能需要下载转换器文件,需要稍等片刻。如果失败,请检查网络连接,或尝试更小的文件。“取消”会停止正在进行的处理;之后可以重新选择文件再试。
实用指南
让扫描件终于能搜索
- 选择不超过 10 页、10 MiB 的扫描版 PDF。
- 选择简体中文、英语、西班牙语或俄语,然后开始识别。
- 在结果中搜索一个已知的词,确认文字层可以使用。
试试这个示例
识别一份 3 页的扫描版学校表格(语言:简体中文);在结果 PDF 中搜索第 2 页印刷的姓名,应能找到并高亮显示。
开始之前: 识别只支持简体中文、英语、西班牙语和俄语,且限 10 页、10 MiB;手写内容或很小的印刷字可能识别不出来。