Този наръчник описва как да преобразувате image в търсим PDF с помощта на Python. Той съдържа подробности за настройване на IDE, списък със стъпки и примерен код за превръщане на изображение в четим PDF с Python. Примерният код може допълнително да бъде подобрен, за да създаде персонализиран изходен PDF файл, като се следват дадените предложения.
Стъпки за конвертиране на изображение в търсим PDF с Python
- Задайте средата да използва Aspose.OCR for Python via .NET за преобразуване на сканирани JPG в PDF
- Импортирайте OCR библиотеката, за да разпознаете текста от JPG и да запазите текста в PDF
- Задайте папката за входни изображения и изходни PDF файлове
- Инициализирайте OCR engine за разпознаване на текст от сканирано изображение
- Заредете сканираното изображение за обработка, използвайки класа OcrInput class
- Стартирайте процеса за разпознаване, за да извлечете текста
- Отпечатайте текста за потребителска информация
- Запазете всеки текстов сегмент в отделен PDF
Горепосочените стъпки обхващат процеса за преобразуване на изображение в търсим PDF с помощта на Python. Импортирайте необходимата библиотека Aspose, приложете лиценза, задайте необходимите папки, създайте OCR двигателя и създайте обекта OcrInput, за да задържате изображенията, необходими за обработка. Изпълнете метода recognize (), за да извлечете текста, обхождайте списъка с резултати, показвайте всеки резултат и запазвайте всеки в отделен PDF файл.
Код за конвертиране на изображение в четим PDF с Python
Горният примерен код демонстрира как да конвертирате JPG в четим PDF с помощта на Python. За подобряване на процеса на конверсия, можете да опитате RecognitionSettings за промяна на поведението, като зададете езика за разпознаване, активирате автоматичното обръщане на цветовете или активирате увеличаването на малкия шрифт. Също така можете да зададете списък с разрешени или игнорирани знаци, да използвате recognize_fast() вместо recognize() за висококачествени изображения и да проверите result.skew, за да се справите с наклонен скан.
Този наръчник обяснява процеса за прилагане на OCR към изображение и запазване на резултата в PDF файл. За премахване на шум от изображение, вижте статията Remove Noise from Image using Python.