Convertir une image en PDF interrogeable avec Python

Ce guide décrit comment convertir image en PDF consultable avec Python. Il contient des détails pour configurer l’IDE, une liste d’étapes, et du code d’exemple pour transformer une image en PDF lisible avec Python. Le code d’exemple peut être davantage amélioré pour créer un fichier PDF de sortie personnalisé en suivant les suggestions données.

Étapes pour convertir une image en PDF consultable avec Python

  1. Définissez l’environnement pour utiliser Aspose.OCR for Python via .NET afin de convertir les JPG numérisés en PDF
  2. Importer la bibliothèque OCR pour reconnaître le texte à partir du JPG et enregistrer le texte en PDF
  3. Définir le dossier pour les images d’entrée et les fichiers PDF de sortie
  4. Instancier le OCR engine pour reconnaître le texte d’une image numérisée
  5. Charger l’image numérisée pour le traitement en utilisant la classe OcrInput
  6. Exécutez le processus de reconnaissance pour extraire le texte
  7. Imprimez le texte pour les informations de l’utilisateur.
  8. Enregistrez chaque segment de texte dans un PDF séparé

Les étapes ci‑dessus englobent le processus de transformation d’une image en PDF consultable à l’aide de Python. Importez la bibliothèque Aspose requise, appliquez la licence, définissez les dossiers nécessaires, instanciez le moteur OCR et créez l’objet OcrInput pour contenir les images nécessaires au traitement. Exécutez la méthode recognize () pour extraire le texte, parcourez la liste des résultats, affichez chaque résultat et enregistrez chacun dans un fichier PDF distinct.

Code pour convertir une image en PDF lisible avec Python

Le code d’exemple ci‑dessus montre comment convertir un JPG en PDF lisible avec Python. Pour améliorer le processus de conversion, vous pouvez essayer RecognitionSettings pour modifier le comportement, comme définir la langue de reconnaissance, activer l’inversion automatique des couleurs ou activer le redimensionnement des petites polices. Vous pouvez également définir une liste de caractères autorisés ou ignorés, utiliser recognize_fast() à la place de recognize() pour les images de haute qualité, et vérifier result.Correction d’inclinaison pour gérer un scan incliné.

Ce guide explique le processus d’application de l’OCR à une image et d’enregistrer le résultat dans un fichier PDF. Pour supprimer le bruit d’une image, consultez l’article Supprimer le bruit d’une image avec Python.

 Français