你的文件会留在你的设备上
文件在你的浏览器中处理,不会上传到我们的服务器。网站可能会下载处理引擎,并发送不含文件内容的使用或反馈事件。
我们如何处理你的数据PDF 转文本
提取 PDF 中的文本:把可搜索的表单或指南里已有的文本层复制成纯文本文件,便于粘贴到笔记里;扫描件需要先做 OCR。
合成示例,运行前请检查操作设置。
你的文档会留在此设备上。工具下载和使用统计不包含文件内容。
本机限制: 单个文件的最大大小: 10 MB
文件在浏览器中处理,不会上传到本站。
实用指南
重用 PDF 里已有的文字
- 选择带有可选取文字的 PDF,而不是印刷页面的扫描件。
- 提取文本,并检查分页位置和阅读顺序。
- 复制或下载 TXT 结果,并把重要的值与 PDF 对照。
试试这个示例
提取一份可搜索的 2 页申请指南中的文本,检查字段标签和说明在 TXT 结果中是否以可用的顺序出现。
之前
- 可选中文本的 PDF
之后
- 纯文本 .txt
开始之前: 此任务读取的是内嵌的可选取文字;扫描页需要 OCR,分栏也可能不按视觉顺序排列。
继续处理源 PDF获得的结果
把嵌入的文本提取为 TXT 文件。扫描页面需要 OCR;原文的阅读顺序可能与可视版面不同。
限制与重要说明
输入最大 10 MiB,最多 200 页,输出文本最大 4 MiB。没有文本层的扫描文档会报错,而不会假装提取成功。阅读顺序、分栏和字体可能与可视版面不一致。这不是 OCR,也不是 PDF 转 Word。
示例
从可搜索的报告中提取文本,在结果框中检查,然后复制或下载。提取文本之后,原始 PDF 仍然可用。