OCR、文档理解和字段提取有什么区别?
用同一张练习采购单,看清扫描件变成文字、表格结构和业务记录时分别要检查什么。

把采购单扫描后,屏幕上已经能显示文字,是否就能把总额和交付日期直接填进系统?还不行。识别字、看懂页面上哪些内容属于同一行、按业务要求填写字段,是三个不同的问题。
实际工具可能把几项能力放在一起。微软的文档处理说明同时谈到文字、表格、勾选项和键值对;Google 的 Form Parser 也结合了 OCR、版面和字段提取。这里区分的是你要检查哪种结果,并不是说每一步必须买一个工具。
用同一张练习采购单看三种结果
下面的内容由作者编写,没有对应的真实订单或扫描图片:
采购单 PO-18
供应商:Harbor Paper
笔记本 12 本 × 5 美元 = 60 美元
文件夹 4 个 × 3 美元 = 12 美元
合计:72 美元
交付日期:[空白]
无论使用哪种工具,都应把原始页面当作核对依据。
| 要求工具做什么 | 可能得到什么 | 人要核对什么 |
|---|---|---|
| OCR(文字识别) | PO-18、72、交付日期 等字符 | 字母、数字、货币符号有没有识错? |
| 理解文档结构 | 两行商品各自的数量、单价和小计,以及单独的合计 | 数值有没有跑到另一行、另一列? |
| 提取业务字段 | 订单号、供应商、合计金额,以及“交付日期未知” | 每个字段能否在原件中找到依据?缺失值是否仍为空? |
OCR 可以一个字都没识错,却丢掉 12 是数量、12 美元 是另一行小计的关系。工具识别了表格,也可能把 72 放错字段。最后得到格式正确的 JSON,仍可能因为系统要求日期而编出一个看似合理的交付日。格式合格不等于内容准确。
这张单据最值得检查的是空白日期。如果系统必须填写日期,应把记录标给人处理,或向供应商确认,不能让 AI 猜一天。微软的说明也提到:工具可能识别到某个字段名,但没有对应值。
从后续用途决定要提取到哪一步
只是想让扫描件可搜索,先识别文字,再抽查模糊处即可。要保留商品行或表单勾选状态,还要看版面结构。要把结果写入系统,则先定义字段、格式、缺失值怎么表示,以及哪些项必须由人复核。
练习单里的算式可以手算:12 × 5 = 60,4 × 3 = 12,合计 72。这能发现一部分错列问题,却不能证明供应商名称、订单号或日期识别正确。重要字段仍要回到原件逐项看;需要追查时,还应保留对应页面的位置或查看入口。
本文帮助你确定处理任务。若要进一步比较具体服务或 API 模型,可分别看 OCR 模型比较和字段提取模型比较;真正采购前还需重查型号与价格。
参考资料
- Microsoft Document Intelligence:通用文档模型:说明文字、结构、键值与缺失值,也注明较新的 API 已弃用旧通用文档模型。
- Google Cloud Document AI:Form Parser:说明 OCR、版面、表格和键值提取如何组合。







