在一个工作区中识别图片和 PDF,并输出结构化 Markdown、分页 JSON、表格块、公式和可复核的版面结果。
适合扫描报告、流水、表格、幻灯片和信息密集的文档截图。
拖拽文件到此处,或点击选择文件
支持 JPEG、PNG、GIF、WebP、BMP、TIFF、HEIC、PDF
文件大小上限:20MB
批量上传:最多 20 个文件
从剪贴板粘贴图片或图片链接
该页面面向搜索 PaddleOCR-VL 文档解析能力的用户:上传文件、保留版面线索、复核识别区域,并导出可用的 Markdown 或 JSON。
使用 Formatted OCR 保留标题、段落、表格、公式和分页块。
当识别结果包含 bbox 时,可在源文件预览中高亮对应区域。
识别后可校对文本块,同时保留原始 OCR 结果。
从网页工作区继续扩展到 API Key、调用日志、积分和运营监控。
当目标是结构化文档输出,而不只是纯文本时,可以使用该工作流。
| 能力 | Image to Text 网页和 API | 普通 OCR 仅文本 | 自建方案 自行开发 |
|---|---|---|---|
| 输出 | |||
| Markdown 和纯文本 | 仅文本 | 取决于实现 | |
| 带块类型的分页 JSON | 取决于实现 | ||
| 表格和公式 | 格式化模式 | 需要额外开发 | |
| 工作流 | |||
| 源文件预览和复核 | 自建 UI | ||
| 历史记录和删除 | 自建存储 | ||
| API 调用日志 | 自建计量 | ||
Formatted OCR 目标是产出可复核、可复制、可导出、可集成的内容。
# 季度报告 | 收入环比增长 12%,支持工单下降 8%。
| 区域 | 收入 | 毛利率 | 尽量保留行列,便于继续导出。
pages[0].blocks 可包含 type、text、confidence、page 和 bbox 字段。
版面 OCR 评估时常见问题。