你的文件会留在你的设备上

文件在你的浏览器中处理,不会上传到我们的服务器。网站可能会下载处理引擎,并发送不含文件内容的使用或反馈事件。

我们如何处理你的数据

PDF 转 HTML

把 PDF 转为 HTML:将家庭指南已有的文字保存为简单的网页,每个源页面对应一个小节;图片和版面不会保留。

合成示例,运行前请检查操作设置。

你的文档会留在此设备上。工具下载和使用统计不包含文件内容。

本机限制: 单个文件的最大大小: 10 MB

文件在浏览器中处理,不会上传到本站。

实用指南

在本机打开按页组织的文本副本

  1. 选择带有可选取文字的 PDF。
  2. 导出 HTML,并在本机打开下载的文件。
  3. 在再次使用之前,对照原件检查各页小节和措辞。

试试这个示例

把一份可搜索的 2 页常见问题 PDF 导出为 HTML。在本机打开,确认每个答案都出现在它所在源页面的小节下,并且不会被当作可执行的标记。

之前

  • 含文本的 PDF 页面

之后

  • HTML 页面分节
此任务的输入和预期输出。 示意示例。

开始之前: HTML 只包含转义后的文本;原有的字体、图片和版面都不会保留,扫描件也不会做 OCR。

继续处理源 PDF
获得的结果

把嵌入的文本导出为独立的 HTML 文档,每页一个分节。文本经过转义,不会作为 HTML 执行。不保留原始字体、图片、表格和版面;不含 OCR。限制:输入 10 MiB,200 页,输出 4 MiB。

限制与重要说明

输入最大 10 MiB,最多 200 页,输出文本最大 4 MiB。没有文本层的扫描文档会报错,而不会假装提取成功。阅读顺序、分栏和字体可能与可视版面不一致。这不是 OCR,也不是 PDF 转 Word。

示例

导出一份基于文本的报告,并在本地打开下载的 HTML。分节顺序与 PDF 页面顺序一致;空白页或扫描页会标明,而不会被悄悄当作已识别的文本。