Конвертировать изображение в поисковый PDF с помощью Python

Это руководство описывает, как конвертировать image в поисковый PDF с помощью Python. В нём содержатся детали настройки IDE, список шагов и пример кода для преобразования изображения в читаемый PDF с использованием Python. Пример кода можно дополнительно улучшить, создав пользовательский PDF‑файл вывода, следуя предложенным рекомендациям.

Шаги по преобразованию изображения в поисковый PDF с помощью Python

  1. Установите окружение для использования Aspose.OCR for Python via .NET для преобразования отсканированных JPG в PDF
  2. Импортировать библиотеку OCR для распознавания текста из JPG и сохранить текст в PDF
  3. Установите папку для входных изображений и выходных PDF‑файлов
  4. Инстанцируйте OCR engine для распознавания текста со сканированного изображения
  5. Загрузите отсканированное изображение для обработки, используя класс OcrInput
  6. Запустите процесс распознавания, чтобы извлечь текст
  7. Вывести текст для информации пользователя
  8. Сохраните каждый текстовый сегмент в отдельный PDF

Вышеперечисленные шаги охватывают процесс преобразования изображения в поисковый PDF с использованием Python. Импортируйте необходимую библиотеку Aspose, примените лицензию, задайте требуемые папки, создайте экземпляр OCR‑движка и создайте объект OcrInput для хранения изображений, необходимых для обработки. Запустите метод recognize () для получения текста, пройдитесь по списку результатов, отобразите каждый результат и сохраните каждый в отдельный PDF‑файл.

Код для преобразования изображения в читаемый PDF с помощью Python

В приведённом выше примере кода показано, как конвертировать JPG в читаемый PDF с помощью Python. Чтобы улучшить процесс конвертации, вы можете попробовать RecognitionSettings для изменения поведения, например, установить язык распознавания, включить автоматическое инвертирование цветов или включить масштабирование мелкого шрифта. Вы также можете задать список разрешённых или игнорируемых символов, использовать recognize_fast() вместо recognize() для изображений высокого качества и проверить result.skew для обработки наклонного сканирования.

Это руководство объясняет процесс применения OCR к изображению и сохранения результата в PDF‑файл. Чтобы удалить шум с изображения, обратитесь к статье Remove Noise from Image using Python.

 Русский