این راهنما توضیح میدهد که چگونه image را به PDF قابل جستجو با استفاده از پایتون تبدیل کنید. جزئیاتی برای تنظیم IDE، فهرستی از مراحل، و کد نمونه برای تغییر یک تصویر به PDF قابل خواندن با پایتون دارد. کد نمونه میتواند برای ایجاد یک فایل PDF خروجی سفارشی با پیروی از پیشنهادات داده شده، بیشتر بهبود یابد.
مراحل تبدیل تصویر به PDF قابل جستجو با استفاده از پایتون
- محیط را تنظیم کنید تا از Aspose.OCR for Python via .NET برای تبدیل JPG اسکنشده به PDF استفاده شود
- کتابخانه OCR را برای شناسایی متن از JPG وارد کنید و متن را به PDF ذخیره کنید
- پوشه را برای تصویر ورودی و فایلهای PDF خروجی تنظیم کنید
- نمونهسازی OCR engine برای تشخیص متن از یک تصویر اسکنشده
- تصویر اسکنشده را برای پردازش با استفاده از کلاس OcrInput بارگذاری کنید
- فرآیند تشخیص را برای استخراج متن اجرا کنید
- متن را برای اطلاعات کاربر چاپ کنید
- هر بخش متنی را در یک PDF جداگانه ذخیره کنید
مراحل فوق شامل فرآیند تبدیل یک تصویر به PDF قابل جستجو با استفاده از Python است. کتابخانه مورد نیاز Aspose را وارد کنید، مجوز را اعمال کنید، پوشههای مورد نیاز را تنظیم کنید، موتور OCR را نمونهسازی کنید و شیء OcrInput را برای نگهداری تصاویر مورد نیاز برای پردازش ایجاد کنید. متد recognize () را اجرا کنید تا متن استخراج شود، بر روی لیست نتایج پیمایش کنید، هر نتیجه را نمایش دهید و هر کدام را در یک فایل PDF جداگانه ذخیره کنید.
کد برای تبدیل تصویر به PDF قابل خواندن با پایتون
کد نمونه بالا نشان میدهد که چگونه میتوان JPG را به PDF قابل خواندن با استفاده از Python تبدیل کرد. برای بهبود فرآیند تبدیل، میتوانید از RecognitionSettings برای تغییر رفتار مانند تنظیم زبان شناسایی، فعالسازی وارونگی خودکار رنگ، یا فعالسازی بزرگنمایی فونت کوچک استفاده کنید. همچنین میتوانید فهرست کاراکترهای مجاز یا نادیدهگرفتهشده را تنظیم کنید، به جای recognize() از recognize_fast() برای تصاویر با کیفیت بالا استفاده کنید، و برای مدیریت اسکن کج result.skew را بررسی کنید.
این راهنما فرآیند اعمال OCR بر روی یک تصویر و ذخیره نتیجه در یک فایل PDF را توضیح میدهد. برای حذف نویز از یک تصویر، به مقاله Remove Noise from Image using Python مراجعه کنید.