不同 OCR 引擎的能力差异很大。简单截图很多引擎都能处理,但发票、表格、公式和扫描 PDF 往往需要更强的文档解析能力。
| 引擎 | 优势 | 取舍 |
|---|---|---|
| Tesseract | 开源、可自托管、适合纯文本 | 版面和表格结构较弱 |
| PaddleOCR-VL | 文档版面解析能力强 | 需要做好供应商集成和调优 |
| Google Vision | 成熟的云端 OCR | 成本和云依赖 |
| Azure OCR | 适合企业云工作流 | 供应商配置较重 |
如何选择
如果源文件是清晰截图,Image to Text 的 Simple OCR 通常足够。如果是带明细行的发票,可以使用 Invoice OCR 或 Formatted OCR。
表格和公式
表格文档使用 Table OCR。公式文档使用 Formula OCR,并导出 Markdown,方便保留接近 LaTeX 的表达。
产品集成
如果你的产品需要稳定接口,可以用 POST /api/v1/ocr 包一层 OCR 能力。这样鉴权、积分、请求日志和响应格式都能保持一致。
成本规划
可以在 Pricing 估算页数成本。Simple OCR 每页 1 积分,Formatted OCR 每页 10 积分。

