Document AI
Mistral OCR 4:OCR 不只读字,还要保留文档结构
Mistral OCR 4 的演示里,最容易被记住的是手写公式变成 LaTeX。但在真实业务里,OCR 不能只看“字识别对不对”。一份文档往往有表格、页眉页脚、脚注、签名、图片、公式和多栏排版。系统需要知道文字从哪一页来、在页面什么位置、属于标题还是表格、置信度高不高。只把页面压成一大段文本,后面的搜索、审核、RAG 都会很难用。
为什么结构比纯文本更要紧
传统 OCR 的问题不是完全不能识别,而是识别结果太扁平。合同里的金额、发票里的税号、论文里的公式、报告里的表格,如果位置和块关系丢了,单个字符再准也容易被系统误用。
更好的 OCR 输出应该带上页面、坐标、块类型、阅读顺序和置信度。这样下游系统才能把低置信区域交给人工复核,把表格按单元格处理,把 RAG 引用定位到原文位置,而不是只给一句“模型说来自某份 PDF”。
接入时不要只看 demo
- 测试扫描 PDF、手机拍照、手写、表格、双栏排版和低清图片。
- 保存原文页码、坐标、OCR 版本、置信度和错误原因。
- 低置信结果不要直接进入自动审批或自动入库。
- 给后续搜索/RAG 做清洗和分块,不要直接塞完整文本。
- 把处理耗时、失败率、人工复核比例纳入监控。
更适合放在文档管道里
OCR 最好不要散落在业务代码里。上传、检查、排队、识别、结构化、人工复核、索引入库应该是完整管道。这样一旦某类文件识别不好,可以回溯、重跑、替换模型,也能解释为什么某个字段被系统采用。
OCR 4 这类产品带来的变化,不是让“识别文字”这一步更酷,而是让文档进入系统后仍然保留来源和结构。对企业文档、知识库、合同审核和 RAG 来说,这比单次演示的准确率更有用。