Dieser Leitfaden beschreibt, wie man image in durchsuchbare PDF mit Python konvertiert. Er enthält Details zur Einrichtung der IDE, eine Schritt-für-Schritt-Liste und Beispielcode zum Umwandeln eines Bildes in ein lesbares PDF mit Python. Der Beispielcode kann weiter verbessert werden, um eine benutzerdefinierte Ausgabedatei im PDF-Format zu erstellen, indem man den gegebenen Vorschlägen folgt.
Schritte zur Umwandlung von Bildern in durchsuchbare PDFs mit Python
- Setze die Umgebung so, dass Aspose.OCR for Python via .NET zum Ändern gescannter JPG in PDF verwendet wird.
- Importiere die OCR‑Bibliothek, um Text aus dem JPG zu erkennen und den Text als PDF zu speichern.
- Ordner für Eingabebild und Ausgabepdf-Dateien festlegen
- Instanziieren Sie das OCR engine um Text aus einem gescannten Bild zu erkennen.
- Laden Sie das gescannte Bild zur Verarbeitung mit der OcrInput Klasse
- Führen Sie den Erkennungsprozess aus, um Text zu extrahieren.
- Drucke den Text für Benutzerinfo
- Speichere jedes Textsegment in einer separaten PDF
Die oben genannten Schritte umfassen den Prozess, ein Bild in ein durchsuchbares PDF mit Python zu verwandeln. Importieren Sie die erforderliche Aspose‑Bibliothek, wenden Sie die Lizenz an, setzen Sie die benötigten Ordner, instanziieren Sie die OCR‑Engine und erstellen Sie das OcrInput‑Objekt, um die für die Verarbeitung erforderlichen Bilder zu halten. Führen Sie die recognize()‑Methode aus, um Text zu extrahieren, iterieren Sie über die Ergebnisliste, zeigen Sie jedes Ergebnis an und speichern Sie jedes in einer separaten PDF‑Datei.
Code zum Umwandeln eines Bildes in ein lesbares PDF mit Python
Der obige Beispielcode zeigt, wie man JPG in ein lesbares PDF mit Python konvertiert. Um den Konvertierungsprozess zu verbessern, können Sie die RecognitionSettings ausprobieren, um das Verhalten zu ändern, z. B. B. die Erkennungssprache festzulegen, die automatische Farbumkehr zu aktivieren oder das Hochskalieren kleiner Schriftarten zu ermöglichen. Sie können auch eine erlaubte oder ignorierte Zeichenliste festlegen, recognize_fast() anstelle von recognize() für hochqualitative Bilder verwenden und das Ergebnis erhalten.Schräglage prüfen, um einen schrägen Scan zu verarbeiten.
Dieser Leitfaden erklärt den Prozess, OCR auf ein Bild anzuwenden und das Ergebnis in einer PDF‑Datei zu speichern. Um Rauschen aus einem Bild zu entfernen, siehe den Artikel Rauschen aus einem Bild mit Python entfernen.