Ваши файлы остаются на устройстве

Файлы обрабатываются в браузере и не загружаются на наши серверы. Сайт может скачивать движки и отправлять события использования или обратной связи без содержимого файлов.

Как мы обращаемся с данными →

Извлечь текст из PDF

Извлеките текст из PDF: скопируйте готовый текстовый слой формы или инструкции в простой текстовый файл для заметок. Сканам сначала нужен OCR.

Учебный пример: проверьте настройки операции перед запуском.

Документы остаются на устройстве. Загрузка движков и статистика не включают содержимое файлов.

Локальные лимиты: Максимальный размер файла: 10 MB

Файлы обрабатываются в вашем браузере. Они не загружаются на этот сайт.

Практическое руководство

Используйте слова, которые уже есть в PDF.

  1. Выберите PDF с выделяемым текстом, а не скан напечатанных страниц.
  2. Извлеките текст и проверьте разрывы страниц и порядок чтения.
  3. Скопируйте или скачайте результат TXT и сверьте важные значения с PDF.

Попробуйте этот пример

Извлеките текст из двухстраничной инструкции к заявлению с поиском по тексту и проверьте, что подписи полей и пояснения идут в TXT в пригодном порядке.

До

  • Выделяемый текст PDF

После

  • Простой текст .txt
Исходный файл и ожидаемый результат этой задачи. Наглядный пример.

Перед началом: Читается встроенный выделяемый текст; сканам нужен OCR, а колонки могут идти не в том порядке, в каком они видны.

Продолжить с исходным PDF
Результат

Извлеките встроенный текст в файл TXT. Для сканированных страниц нужен OCR; порядок чтения в источнике может отличаться от видимого макета.

Ограничения

Не более 10 МиБ на входе, 200 страниц и 4 МиБ текста на выходе. Для сканированных документов без текстового слоя выдаётся ошибка вместо ложного успешного извлечения. Порядок чтения, колонки и шрифты могут не совпадать с визуальным макетом. Это не OCR и не PDF в Word.

Пример

Извлеките текст из отчёта с поиском по тексту, просмотрите его в поле результата и скопируйте или скачайте. Исходные PDF остаются доступными после получения текста.