将扫描 PDF 和文档截图转为结构化 Markdown,并保留分页块、表格、公式和源文件复核能力。
报告、流水、手册、论文和多页 PDF 建议使用 Formatted OCR。
拖拽文件到此处,或点击选择文件
支持 JPEG、PNG、GIF、WebP、BMP、TIFF、HEIC、PDF
文件大小上限:20MB
批量上传:最多 20 个文件
从剪贴板粘贴图片或图片链接
该页面解决原始 PDF 文本提取和可用 Markdown 之间的差距,适合标题、表格、公式和页边界都很重要的 PDF。
多页 PDF 结果按页展示,让复核和导出更可控。
Formatted OCR 尽量保留标题、段落、列表、表格和公式标记。
复制或下载前,可以先校对文本块。
多个 PDF 可使用批量 OCR,自动化场景可调用 OCR API。
基础提取容易丢失结构,格式化 OCR 更适合生成可复核的 Markdown。
| 输出需求 | Formatted OCR Markdown + JSON | Simple OCR 纯文本 | PDF 文本层 取决于文件 |
|---|---|---|---|
| 结构 | |||
| 标题和段落 | 平铺文本 | 取决于文件 | |
| 表格 | 格式化块 | 经常破碎 | |
| 公式保留 | 尽力保留 | ||
| 工作流 | |||
| 分页展示 | 取决于文件 | ||
| 可编辑 OCR 结果 | |||
| API 自动化 | 自定义 | ||
扫描 PDF 可以转为更容易复核和复用的结构化内容。
# 产品需求 | ## 验收标准 | - OCR 结果可编辑
| 指标 | 当前值 | 目标值 | 识别到行列后可复制为表格。
每页可包含带 type、text、confidence、bbox 和页码的块。
关于扫描 PDF 和布局保留的说明。