你的文件会留在你的设备上
文件在你的浏览器中处理,不会上传到我们的服务器。网站可能会下载处理引擎,并发送不含文件内容的使用或反馈事件。
我们如何处理你的数据PDF 转 HTML
把 PDF 转为 HTML:将家庭指南已有的文字保存为简单的网页,每个源页面对应一个小节;图片和版面不会保留。
合成示例,运行前请检查操作设置。
你的文档会留在此设备上。工具下载和使用统计不包含文件内容。
本机限制: 单个文件的最大大小: 10 MB
文件在浏览器中处理,不会上传到本站。
实用指南
在本机打开按页组织的文本副本
- 选择带有可选取文字的 PDF。
- 导出 HTML,并在本机打开下载的文件。
- 在再次使用之前,对照原件检查各页小节和措辞。
试试这个示例
把一份可搜索的 2 页常见问题 PDF 导出为 HTML。在本机打开,确认每个答案都出现在它所在源页面的小节下,并且不会被当作可执行的标记。
之前
- 含文本的 PDF 页面
之后
- HTML 页面分节
开始之前: HTML 只包含转义后的文本;原有的字体、图片和版面都不会保留,扫描件也不会做 OCR。
继续处理源 PDF获得的结果
把嵌入的文本导出为独立的 HTML 文档,每页一个分节。文本经过转义,不会作为 HTML 执行。不保留原始字体、图片、表格和版面;不含 OCR。限制:输入 10 MiB,200 页,输出 4 MiB。
限制与重要说明
输入最大 10 MiB,最多 200 页,输出文本最大 4 MiB。没有文本层的扫描文档会报错,而不会假装提取成功。阅读顺序、分栏和字体可能与可视版面不一致。这不是 OCR,也不是 PDF 转 Word。
示例
导出一份基于文本的报告,并在本地打开下载的 HTML。分节顺序与 PDF 页面顺序一致;空白页或扫描页会标明,而不会被悄悄当作已识别的文本。