2026 年 OCR 模型怎么选:扫描 PDF、表格还原与 API 成本
比较 Mistral OCR、Google Document AI 和 PaddleOCR,分清文字识别、版面恢复与字段提取,并按可用页面和人工修正计算成本。

发票里的数字可能全部识别正确,单价却对应到了另一件商品。OCR,也就是光学字符识别,负责从图片中读出文字;恢复页面上的顺序和对应关系,是另一项要求,而且经常决定结果能不能用。
托管文档解析,我们会先试 Mistral OCR 4.1;只需要识字时,用 Google Enterprise Document OCR 建立基准;确实需要自己维护本地处理时,再考虑 PaddleOCR。 需要文档结构时加入 Google Layout Parser;已有流程也可以保留价格更低的 Mistral OCR 3 作对照。这是按输出需要选择的候选名单,不是独立实测准确率排名。
来源和价格核查于 2026 年 9 月 7 日。本文比较 OCR 模型及其服务,同时注明哪些名称实际上是处理器或工具包,不把它们都当成可下载的单一模型。PDF 聊天应用、从已有文字中提取字段,不在本篇比较范围。
先决定要拿到什么结果
| 候选 | 需要评估什么 | 主要选择依据 |
|---|---|---|
| Mistral OCR 4.1 | 带内容块信息的文档解析 | 能否保留业务需要的对应关系 |
| Mistral OCR 3 | 仍然可用、价格较低的 OCR 接口 | 新版输出是否值得改动现有集成 |
| Google Enterprise Document OCR | 托管文字识别处理器 | 只拿到文字是否已经足够 |
| 同一价格页中的 Google Layout Parser | 结构提取与初始分块 | 标题层级和表格关系是否保留 |
| PaddleOCR | 可在本地部署的识别与解析工具包 | 是否有能力维护、评估所选流程 |
Mistral 的 OCR 处理器指南说明了 OCR 4 及后续版本的内容块提取能力。制作记录中应保留确切模型 ID;latest 别名便于接入,却会随版本更新,让旧测试难以复现。
PaddleOCR 不是只有一个分数的单一模型。仓库中有文字识别与文档解析组件,包括 PaddleOCR-VL。实际部署要固定版本和配置。下载软件后虽然不再收到托管服务的按页账单,计算资源、安装、升级和复核仍然有成本。
如果 PDF 已有准确的文字层,应先检查能否直接使用,不必重复付费识别。遇到扫描件,则按真实扫描质量抽样。清晰的电子导出文件和歪斜的手机照片,不应该共用一个没有条件的准确率结论。
处理一万页,需要多少钱
下面按 处理一万页计算美元用量费用,未计税、存储、重试、可选功能和协商折扣。Google OCR 一行先不扣免费额度,以便看清付费单价。
| 服务与处理选项 | 每千页官方费率 | 示例用量费用 |
|---|---|---|
| Google Enterprise Document OCR,标准付费档 | $1.50 | 扣额度前 $15 |
| Mistral OCR 3,仅 OCR | $2 | $20 |
| Mistral OCR 4.1,仅 OCR | $4 | $40 |
| Mistral OCR 4.1,带标注页面 | $5 | $50 |
| Google Layout Parser | $10 | $100 |
| 自托管 PaddleOCR | 自有基础设施成本 | 按部署结果测量 |
Google 当前标准 OCR 价格包含前 1,000 页免费额度;如果额度全部可用,一万页的这一项费用为 13.50 美元。Layout Parser 与 OCR 附加功能另行计费,不能用每千页 1.50 美元代表 Document AI 的全部能力。
同样,Mistral 仅 OCR 的单价,也不是带标注页面的价格。先确定后续程序要消费哪一种输出,再比较费用。处理结果都不同,单价之差不能直接说明谁更高效。
表格里的字都对,结果也可能不能用
可以先用一张自行设计的虚构采购单确定验收标准:
| 商品 | 数量 | 单价 | 行小计 |
|---|---|---|---|
| 蓝色文件夹 | 12 | $2.50 | $30.00 |
| 白色文件夹 | 8 | $3.00 | $24.00 |
将自己的测试文档打印或渲染出来,再加入扫描版和倾斜拍照版。应得到的小计是 54.00 美元。即使六个数字都出现在结果中,只要两件商品的单价被交换,表格就没有还原正确。
至少分别检查文字本身、数值所在的行列、标题备注与合计之间的阅读顺序。原件留空的格子,不应被补上猜测值;说明运费是否包含的脚注,可能比空格格式重要得多。
评分前,不要让第二个模型悄悄修复 OCR 结果。那样测到的是“OCR 加修复”的整套流程。这种做法可能有用,但额外费用和补造信息的可能性都应留在记录中。
批量抽样既要有普通文件,也要有实际容易出错的类别,例如淡字扫描、合并单元格、多栏排版、旋转文字或手写补充。按文档类型记录表现。大量简单页面拉高的平均值,可能掩盖某一类文件仍需人工处理的事实。
榜单帮助筛候选,原件决定是否通过
OmniDocBench提供文档解析数据与评估方法,涉及文字、表格、公式和阅读顺序等要素。对本篇而言,它的价值在于把不同要求拆开。引用成绩前,应核对数据集版本、测试模型和运行配置。
我们没有重跑该基准,也没有让全部当前接口处理上面的采购单。公开数据集上的成绩,可以支持进一步试用,不能保证模型适合你的供应商版式。厂商自己公布的比较,也应保留来源身份。
实际选型要算一批通过验收的文档花了多少钱。假设某服务处理一万页收费 40 美元,其中 200 页各需修正两分钟,人工按每小时 30 美元计算,复核就增加 200 美元,合计 240 美元。这些错误数量和人工费率是假设,不对应表中任何服务的实测。
因此,每页便宜一点,未必抵得过一种反复出现的表格错误。记录处理页数时,也记录修正时间,把废弃页面的支出留在总成本里。
文字和版面可靠后,可以再让信息提取模型把结果整理成供应商、金额、交付日期等字段。始终保留原始页面,方便回查。结构化记录是否有用,最终还取决于有疑问的值能不能追溯到原件。
参考资料
- Mistral OCR 4.1与 OCR 3:具体型号、可用状态和按页费率。
- Mistral OCR 处理器指南:文档输入与内容块提取。
- Google Document AI 价格:不同处理器的费率和额度。
- PaddleOCR 仓库:可部署的识别和解析组件。
- OmniDocBench:文档解析评估方法与数据集范围。







