使用 Python 将图像转换为可搜索的 PDF

本指南描述了如何 使用 Python 将 image 转换为可搜索的 PDF。它提供了设置 IDE 的详细信息、步骤列表,以及将 图像转换为可读 PDF 的 Python 示例代码。通过遵循给出的建议,示例代码还可以进一步增强,以创建自定义输出 PDF 文件。

使用 Python 将图像转换为可搜索 PDF 的步骤

  1. 将环境设置为使用 Aspose.OCR for Python via .NET 将扫描的 JPG 转换为 PDF
  2. 导入 OCR 库以识别 JPG 中的文本并将文本保存为 PDF
  3. 设置输入图像和输出 PDF 文件的文件夹
  4. 实例化 OCR engine 以识别扫描图像中的文本
  5. 使用 OcrInput 类加载扫描图像进行处理
  6. 运行识别过程以提取文本
  7. 打印用户信息的文本
  8. 将每个文本段落保存为单独的 PDF

上述步骤涵盖了将 image to searchable PDF using Python 转换的过程。导入所需的 Aspose 库,应用许可证,设置所需的文件夹,实例化 OCR 引擎,并创建 OcrInput 对象以保存处理所需的图像。运行 recognize () 方法获取文本,遍历结果列表,显示每个结果,并将每个结果保存为单独的 PDF 文件。

使用 Python 将图像转换为可读 PDF 的代码

上述示例代码演示了如何 使用 Python 将 JPG 转换为可读的 PDF。为了改进转换过程,您可以尝试 RecognitionSettings 来更改行为,例如设置识别语言、启用自动颜色反转或启用小字体放大。您还可以设置允许或忽略的字符列表,使用 recognize_fast() 替代 recognize() 以处理高质量图像,并检查 result.skew 以处理倾斜的扫描。

本指南解释了对图像应用 OCR 并将结果保存为 PDF 文件的过程。要从图像中去除噪声,请参阅文章 使用 Python 去除图像噪声.

 简体中文