Chuyển Đổi Hình Ảnh Thành PDF Có Thể Tìm Kiếm Bằng Python

Hướng dẫn này mô tả cách chuyển image thành PDF có thể tìm kiếm được bằng Python. Nó có chi tiết để thiết lập IDE, danh sách các bước, và mã mẫu để chuyển đổi một hình ảnh thành PDF có thể đọc được bằng Python. Mã mẫu có thể được nâng cấp thêm để tạo một tệp PDF đầu ra tùy chỉnh bằng cách làm theo các đề xuất đã cho.

Các bước chuyển đổi hình ảnh thành PDF có thể tìm kiếm bằng Python

  1. Đặt môi trường để sử dụng Aspose.OCR for Python via .NET cho việc chuyển đổi JPG đã quét sang PDF
  2. Nhập thư viện OCR để nhận dạng văn bản từ JPG và lưu văn bản thành PDF
  3. Đặt thư mục cho hình ảnh đầu vào và tệp PDF đầu ra
  4. Khởi tạo OCR engine để nhận dạng văn bản từ hình ảnh đã quét
  5. Tải hình ảnh đã quét để xử lý bằng lớp OcrInput
  6. Chạy quá trình nhận dạng để trích xuất văn bản
  7. Trong văn bản cho thông tin người dùng
  8. Lưu mỗi đoạn văn bản vào một PDF riêng

Những bước trên bao gồm quy trình chuyển đổi một hình ảnh thành PDF có thể tìm kiếm bằng Python. Nhập thư viện Aspose cần thiết, áp dụng giấy phép, thiết lập các thư mục cần thiết, khởi tạo engine OCR, và tạo đối tượng OcrInput để chứa các hình ảnh cần xử lý. Chạy phương thức recognize () để lấy văn bản, lặp qua danh sách kết quả, hiển thị mỗi kết quả, và lưu mỗi kết quả vào một tệp PDF riêng.

Mã chuyển ảnh thành PDF có thể đọc được bằng Python

Mã mẫu ở trên minh họa cách chuyển đổi JPG thành PDF có thể đọc được bằng Python. Để cải thiện quá trình chuyển đổi, bạn có thể thử RecognitionSettings để thay đổi hành vi như thiết lập ngôn ngữ nhận dạng, bật tự động đảo màu, hoặc bật việc phóng to phông chữ nhỏ. Bạn cũng có thể đặt danh sách ký tự cho phép hoặc bỏ qua, sử dụng recognize_fast() thay vì recognize() cho hình ảnh chất lượng cao, và kiểm tra result.skew để xử lý bản quét nghiêng.

Hướng dẫn này giải thích quy trình áp dụng OCR cho một hình ảnh và lưu kết quả dưới dạng tệp PDF. Để loại bỏ nhiễu khỏi hình ảnh, hãy tham khảo bài viết Remove Noise from Image using Python.

 Tiếng Việt