返回全部文章
文章

2026 年 OCR 模型怎么选:扫描 PDF、表格还原与 API 成本

作者:

比较 Mistral OCR、Google Document AI 和 PaddleOCR,分清文字识别、版面恢复与字段提取,并按可用页面和人工修正计算成本。

一张带简单表格的扫描纸,放大镜贴合在纸面上

发票里的数字可能全部识别正确,单价却对应到了另一件商品。OCR,也就是光学字符识别,负责从图片中读出文字;恢复页面上的顺序和对应关系,是另一项要求,而且经常决定结果能不能用。

托管文档解析,我们会先试 Mistral OCR 4.1;只需要识字时,用 Google Enterprise Document OCR 建立基准;确实需要自己维护本地处理时,再考虑 PaddleOCR。 需要文档结构时加入 Google Layout Parser;已有流程也可以保留价格更低的 Mistral OCR 3 作对照。这是按输出需要选择的候选名单,不是独立实测准确率排名。

来源和价格核查于 2026 年 9 月 7 日。本文比较 OCR 模型及其服务,同时注明哪些名称实际上是处理器或工具包,不把它们都当成可下载的单一模型。PDF 聊天应用、从已有文字中提取字段,不在本篇比较范围。

先决定要拿到什么结果

候选需要评估什么主要选择依据
Mistral OCR 4.1带内容块信息的文档解析能否保留业务需要的对应关系
Mistral OCR 3仍然可用、价格较低的 OCR 接口新版输出是否值得改动现有集成
Google Enterprise Document OCR托管文字识别处理器只拿到文字是否已经足够
同一价格页中的 Google Layout Parser结构提取与初始分块标题层级和表格关系是否保留
PaddleOCR可在本地部署的识别与解析工具包是否有能力维护、评估所选流程

Mistral 的 OCR 处理器指南说明了 OCR 4 及后续版本的内容块提取能力。制作记录中应保留确切模型 ID;latest 别名便于接入,却会随版本更新,让旧测试难以复现。

PaddleOCR 不是只有一个分数的单一模型。仓库中有文字识别与文档解析组件,包括 PaddleOCR-VL。实际部署要固定版本和配置。下载软件后虽然不再收到托管服务的按页账单,计算资源、安装、升级和复核仍然有成本。

如果 PDF 已有准确的文字层,应先检查能否直接使用,不必重复付费识别。遇到扫描件,则按真实扫描质量抽样。清晰的电子导出文件和歪斜的手机照片,不应该共用一个没有条件的准确率结论。

处理一万页,需要多少钱

下面按 处理一万页计算美元用量费用,未计税、存储、重试、可选功能和协商折扣。Google OCR 一行先不扣免费额度,以便看清付费单价。

服务与处理选项每千页官方费率示例用量费用
Google Enterprise Document OCR,标准付费档$1.50扣额度前 $15
Mistral OCR 3,仅 OCR$2$20
Mistral OCR 4.1,仅 OCR$4$40
Mistral OCR 4.1,带标注页面$5$50
Google Layout Parser$10$100
自托管 PaddleOCR自有基础设施成本按部署结果测量

Google 当前标准 OCR 价格包含前 1,000 页免费额度;如果额度全部可用,一万页的这一项费用为 13.50 美元。Layout Parser 与 OCR 附加功能另行计费,不能用每千页 1.50 美元代表 Document AI 的全部能力。

同样,Mistral 仅 OCR 的单价,也不是带标注页面的价格。先确定后续程序要消费哪一种输出,再比较费用。处理结果都不同,单价之差不能直接说明谁更高效。

表格里的字都对,结果也可能不能用

可以先用一张自行设计的虚构采购单确定验收标准:

商品数量单价行小计
蓝色文件夹12$2.50$30.00
白色文件夹8$3.00$24.00

将自己的测试文档打印或渲染出来,再加入扫描版和倾斜拍照版。应得到的小计是 54.00 美元。即使六个数字都出现在结果中,只要两件商品的单价被交换,表格就没有还原正确。

至少分别检查文字本身、数值所在的行列、标题备注与合计之间的阅读顺序。原件留空的格子,不应被补上猜测值;说明运费是否包含的脚注,可能比空格格式重要得多。

评分前,不要让第二个模型悄悄修复 OCR 结果。那样测到的是“OCR 加修复”的整套流程。这种做法可能有用,但额外费用和补造信息的可能性都应留在记录中。

批量抽样既要有普通文件,也要有实际容易出错的类别,例如淡字扫描、合并单元格、多栏排版、旋转文字或手写补充。按文档类型记录表现。大量简单页面拉高的平均值,可能掩盖某一类文件仍需人工处理的事实。

榜单帮助筛候选,原件决定是否通过

OmniDocBench提供文档解析数据与评估方法,涉及文字、表格、公式和阅读顺序等要素。对本篇而言,它的价值在于把不同要求拆开。引用成绩前,应核对数据集版本、测试模型和运行配置。

我们没有重跑该基准,也没有让全部当前接口处理上面的采购单。公开数据集上的成绩,可以支持进一步试用,不能保证模型适合你的供应商版式。厂商自己公布的比较,也应保留来源身份。

实际选型要算一批通过验收的文档花了多少钱。假设某服务处理一万页收费 40 美元,其中 200 页各需修正两分钟,人工按每小时 30 美元计算,复核就增加 200 美元,合计 240 美元。这些错误数量和人工费率是假设,不对应表中任何服务的实测。

因此,每页便宜一点,未必抵得过一种反复出现的表格错误。记录处理页数时,也记录修正时间,把废弃页面的支出留在总成本里。

文字和版面可靠后,可以再让信息提取模型把结果整理成供应商、金额、交付日期等字段。始终保留原始页面,方便回查。结构化记录是否有用,最终还取决于有疑问的值能不能追溯到原件。

参考资料