跳到主要内容
Vecaria

PDF OCR 识别

云端处理免费 3 次/日

在线对扫描版 PDF 做 OCR,输出纯文本或可搜索 PDF(文字层),服务端 tesseract 处理,支持中英文。

需登录;云端任务计入云端额度(免费/Pro 规则见定价页)。

使用方法

  1. 上传扫描版 PDF
  2. 选择语言(eng / chi_sim / 两者)、输出(txt 或可搜索 pdf)与 DPI
  3. 云端处理完成后下载

功能说明

  • pypdfium2(BSD-3/Apache-2.0)栅格化 + tesseract(Apache-2.0)OCR
  • 可输出带文字层的可搜索 PDF,便于检索与复制

隐私

上传文件仅用于本次识别,云端文件按保留策略自动清理。

如何使用

  1. 选择或拖入文件
  2. 按需调整输出选项
  3. 点击处理按钮,下载输出文件

常见问题

PDF 文件大小有限制吗?

本地处理适合 10MB 以内的文件;更大的文件可使用 Pro 云端处理。

压缩会让 PDF 变小吗?

压缩通过重写 PDF 结构(对象流)减小体积;对本身已高度压缩的 PDF,效果可能有限。

我的文件会被上传吗?

云端处理会上传文件:经加密通道传输,默认保存 30 天后自动删除,也可随时手动删除。

限制说明

  • 需登录;计入云端额度
  • 基于 tesseract(Apache-2.0);识别质量取决于扫描清晰度
  • 高 DPI 更准但更慢,建议 200–300

隐私说明

本地处理不上传;选择 Pro 云端处理时文件才会经加密通道上传,默认保存 30 天后自动删除,也可提前手动删除。