你的文件会留在你的设备上

文件在你的浏览器中处理,不会上传到我们的服务器。网站可能会下载处理引擎,并发送不含文件内容的使用或反馈事件。

我们如何处理你的数据

PDF 转文本

提取 PDF 中的文本:把可搜索的表单或指南里已有的文本层复制成纯文本文件,便于粘贴到笔记里;扫描件需要先做 OCR。

合成示例,运行前请检查操作设置。

你的文档会留在此设备上。工具下载和使用统计不包含文件内容。

本机限制: 单个文件的最大大小: 10 MB

文件在浏览器中处理,不会上传到本站。

实用指南

重用 PDF 里已有的文字

  1. 选择带有可选取文字的 PDF,而不是印刷页面的扫描件。
  2. 提取文本,并检查分页位置和阅读顺序。
  3. 复制或下载 TXT 结果,并把重要的值与 PDF 对照。

试试这个示例

提取一份可搜索的 2 页申请指南中的文本,检查字段标签和说明在 TXT 结果中是否以可用的顺序出现。

之前

  • 可选中文本的 PDF

之后

  • 纯文本 .txt
此任务的输入和预期输出。 示意示例。

开始之前: 此任务读取的是内嵌的可选取文字;扫描页需要 OCR,分栏也可能不按视觉顺序排列。

继续处理源 PDF
获得的结果

把嵌入的文本提取为 TXT 文件。扫描页面需要 OCR;原文的阅读顺序可能与可视版面不同。

限制与重要说明

输入最大 10 MiB,最多 200 页,输出文本最大 4 MiB。没有文本层的扫描文档会报错,而不会假装提取成功。阅读顺序、分栏和字体可能与可视版面不一致。这不是 OCR,也不是 PDF 转 Word。

示例

从可搜索的报告中提取文本,在结果框中检查,然后复制或下载。提取文本之后,原始 PDF 仍然可用。