ファイルはお使いの端末に残ります

ファイルの処理はブラウザー内で行われ、当社のサーバーにはアップロードされません。サイトは処理エンジンをダウンロードしたり、ファイルの内容を含まない利用状況やフィードバックのイベントを送信したりすることがあります。

データの取り扱いについて

PDFからHTML

PDFをHTMLに変換します。家庭用ガイドのテキストを、元の1ページにつき1セクションのシンプルなウェブページとして保存します。画像とレイアウトは含みません。

サンプルは合成データです。実行する前に操作の設定を確認してください。

ドキュメントはこの端末に残ります。ツールのダウンロードと利用統計には、ファイルの内容は含まれません。

端末での制限: 1ファイルの最大サイズ: 10 MB

ファイルはお使いのブラウザー内で処理されます。このサイトにはアップロードされません。

実践ガイド

ページごとに整理したテキストのコピーをローカルで開く

  1. 選択できるテキストを含むPDFを選択してください。
  2. HTMLを書き出し、ダウンロードしたファイルをローカルで開いてください。
  3. 再利用する前に、ページごとのセクションと文言を元のファイルと見比べてください。

この例を試す

検索できる2ページのFAQのPDFをHTMLに書き出します。ローカルで開き、各回答が元のページのセクションの下にあり、実行可能なマークアップとして扱われていないことを確認してください。

変更前

  • テキストを含むPDFのページ

変更後

  • HTMLのページセクション
このタスクの入力と、期待される結果 説明用の例です。

始める前に: HTMLにはエスケープされたテキストだけが含まれます。元のフォント、画像、レイアウトは保持されず、スキャンにはOCRは行われません。

元のPDFで作業を続ける
得られる結果

埋め込まれたテキストを、1ページにつき1つのセクションで構成された単体のHTMLドキュメントに書き出します。テキストはエスケープされ、HTMLとして実行されません。元のフォント、画像、表、レイアウトは保持されません。OCRはありません。上限:入力10MiB、200ページ、出力4MiB。

制限事項と重要な注意点

入力は10MiB、200ページ、出力テキストは4MiBまでです。テキストレイヤーのないスキャン文書では、抽出に成功したように見せかけず、エラーが表示されます。読み順、段組み、フォントは見た目のレイアウトと一致しない場合があります。OCRでもPDFからWordへの変換でもありません。

例

テキストベースのレポートを書き出し、ダウンロードしたHTMLをローカルで開いてください。セクションはPDFのページ順に並びます。空白ページやスキャンされたページには、認識されたテキストとして黙って扱われず、その旨が表示されます。