Μετατροπή εικόνας σε αναζητήσιμο PDF χρησιμοποιώντας Python

Αυτός ο οδηγός περιγράφει πώς να μετατρέψετε το image σε αναζητήσιμο PDF χρησιμοποιώντας Python. Περιλαμβάνει λεπτομέρειες για τη ρύθμιση του IDE, μια λίστα βημάτων και δείγμα κώδικα για τη μετατροπή μιας εικόνας σε αναγνώσιμο PDF χρησιμοποιώντας Python. Ο κώδικας δείγματος μπορεί να βελτιωθεί περαιτέρω για τη δημιουργία προσαρμοσμένου αρχείου PDF εξόδου ακολουθώντας τις δοθείσες προτάσεις.

Βήματα για τη μετατροπή εικόνας σε αναζητήσιμο PDF με τη χρήση της Python

  1. Ορίστε το περιβάλλον ώστε να χρησιμοποιεί Aspose.OCR for Python via .NET για τη μετατροπή σαρωμένων JPG σε PDF
  2. Εισάγετε τη βιβλιοθήκη OCR για να αναγνωρίσετε κείμενο από το JPG και να αποθηκεύσετε το κείμενο σε PDF
  3. Ορίστε το φάκελο για τις εικόνες εισόδου και τα αρχεία PDF εξόδου
  4. Δημιουργήστε ένα στιγμιότυπο του OCR engine για να αναγνωρίσετε κείμενο από μια σαρωμένη εικόνα
  5. Φορτώστε την σαρωμένη εικόνα για επεξεργασία χρησιμοποιώντας την κλάση OcrInput
  6. Εκτελέστε τη διαδικασία αναγνώρισης για την εξαγωγή κειμένου
  7. Εκτύπωση του κειμένου για πληροφορίες χρήστη
  8. Αποθηκεύστε κάθε τμήμα κειμένου σε ξεχωριστό PDF

Τα παραπάνω βήματα περιλαμβάνουν τη διαδικασία μετατροπής μιας εικόνας σε αναζητήσιμο PDF χρησιμοποιώντας Python. Εισάγετε τη απαιτούμενη βιβλιοθήκη Aspose, εφαρμόστε την άδεια, ορίστε τους απαιτούμενους φακέλους, δημιουργήστε τη μηχανή OCR και δημιουργήστε το αντικείμενο OcrInput για να κρατήσει τις εικόνες που απαιτούνται για την επεξεργασία. Εκτελέστε τη μέθοδο recognize () για να ανακτήσετε το κείμενο, επαναλάβετε τη λίστα των αποτελεσμάτων, εμφανίστε κάθε αποτέλεσμα και αποθηκεύστε το καθένα σε ξεχωριστό αρχείο PDF.

Κώδικας για τη Μετατροπή Εικόνας σε Αναγνώσιμο PDF με Python

Ο παραπάνω κώδικας δείγματος δείχνει πώς να μετατρέψετε JPG σε αναγνώσιμο PDF χρησιμοποιώντας Python. Για να βελτιώσετε τη διαδικασία μετατροπής, μπορείτε να δοκιμάσετε το RecognitionSettings για αλλαγή της συμπεριφοράς, όπως ο καθορισμός της γλώσσας αναγνώρισης, η ενεργοποίηση της αυτόματης αντιστροφής χρώματος ή η ενεργοποίηση της κλιμάκωσης μικρών γραμματοσειρών. Μπορείτε επίσης να ορίσετε μια λίστα επιτρεπόμενων ή αγνοημένων χαρακτήρων, να χρησιμοποιήσετε το recognize_fast() αντί για το recognize() για εικόνες υψηλής ποιότητας, και να ελέγξετε το result.skew για να διαχειριστείτε μια κεκλιμένη σάρωση.

Αυτός ο οδηγός εξηγεί τη διαδικασία εφαρμογής OCR σε μια εικόνα και αποθήκευσης του αποτελέσματος σε αρχείο PDF. Για να αφαιρέσετε τον θόρυβο από μια εικόνα, ανατρέξτε στο άρθρο Αφαίρεση θορύβου από εικόνα χρησιμοποιώντας Python.

 Ελληνικά