一页官方文档,标了两个日期,报了两种货币的价格,连模型能不能直接调用都说不清楚——这不是哪个小站的山寨镜像,是 Mistral AI 自己挂出来的 OCR 4.1 产品页。

事情本身不复杂:Mistral 在 Document AI 技术栈里更新了 OCR 服务,新增段落级边界框提取、结构化区块标签和区块级置信度评分,页面标注状态是 Public Preview、日期写着 2026 年 7 月 16 日。听起来是一次常规迭代。但只要多翻几个信息源,这次"常规迭代"就开始露馅。

新增了什么,几句话说完

OCR 4.1 主要在三件事上做了加法:

  • 边界框(bbox).调用时加上 include_blocks=true,返回内容会带段落级坐标、阅读顺序,以及 text、title、table、equation、signature 等十余种结构标签。
  • 置信度评分.通过 confidence_scores_granularity 选择 page 或 word 两档,不设置就不返回,默认不打分。
  • 细节修补.边界框不再漂移、不再嵌套图片,引用页每条引文对应单一 bbox,复杂排版漏检更少,双引号能保留,复选框样式识别更多,从右到左排版的表格解析更准。

这些是实打实的工程细节,面向的是 RAG 管道和结构化文档处理的开发者——他们要的不是"识别出文字",而是"识别出结构",这样才能喂给下游的大模型或规则引擎。


一页文档,对不上的两笔账

问题出在文档之外能查到的信息,和文档本身互相矛盾。

日期对不上:产品页写 7 月 16 日,但另有信息显示 OCR 4.1 实际发布于 8 月 13 日,前后差了近一个月。是页面缓存滞后,还是区域发布节奏不同,官方没有说明。

价格单位对不上:文档页用欧元标价,OCR 每千页 3.5 欧元、带标注的处理每千页 4.38 欧元;而 Mistral 官方定价页给出的是美元口径,OCR 每千页 4 美元、标注处理每千页 5 美元,并且这个价格从 6 月 23 日 OCR 4 发布起就没变过。两者是不是同一个价格的不同货币表述,没有交叉验证。更让人起疑的是另一条线索:早期版本的价格曾被引用为约合 1 美元/千页,如果属实,现在的价格相当于翻了三到五倍——但这条信息本身来源存疑,只能存而不论。

模型 ID 能不能直接调用也不确定:mistral-ocr-latest 这个别名已经指向 4.1,但官方模型目录和更新日志似乎还停留在 4.0,mistral-ocr-4-1 这个具体 ID 是否已经开放,没有明确说法。

  • 提醒.生产环境如果要锁定版本,现在贸然写死 mistral-ocr-4-1 有风险,更稳妥的做法是先用 mistral-ocr-latest 观察,等模型目录同步更新后再钉版本号。

便宜是真便宜,但得看跟谁比

Mistral 做 OCR,打的从来不是 Google Document AI、Azure AI Document Intelligence、Amazon Textract 那条"表单字段精准提取"的路线,而是"文档重建 + 多语言 + 复杂排版 + 公式识别"这条更偏向大模型下游消费的路线。云厂商的基础 OCR 起步价通常在每千页一到一点五美元,一旦叠加表单、表格、发票这类结构化字段提取,价格能冲到每千页数十美元。Mistral 用一个更统一、更便宜的价位,换的是"布局还原+Markdown 友好输出"这个细分场景,而不是正面硬刚字段级精度。

这个定位是清楚的,也大体成立。但便宜不等于可信——尤其当这次的官方发布信息本身就自相矛盾时。

发布页打架,说明了什么

孔子说"名不正则言不顺",放在产品发布上同样适用:连自己的名字、日期、价格都对不齐,后面的功能描述再漂亮,也让人先打个问号。

这不是 Mistral 一家的毛病。AI 基础设施类产品迭代太快,文档、模型目录、定价页、社区讨论往往是四套独立系统,更新节奏各走各的,官方通稿式的"发布即最终"叙事,在这个行业已经越来越靠不住。

官宣先信一半,剩下一半等第三方验证

对企业采购方来说,这意味着几件具体的事要做在决策之前:去实际调用一次接口,确认真实计费单位;别直接钉死一个看起来很新的模型 ID,先用 latest 别名观察几周;置信度评分这类新字段,先在自己的文档类型上跑一批小样本,看阈值该定在哪里,而不是照抄官方示例;等一等是否有第三方基准(比如 OmniDocBench 之类的公开榜单)给出独立跑分,再决定要不要把生产流程切过去。

功能本身没问题,段落级 bbox 和置信度评分对做金融合同审核、发票核验这类需要人工复核触发点的场景确实有用。但工具好不好用,是一回事;官方说的话能不能直接信,是另一回事。这次 Mistral 至少提醒了所有做技术选型的人:发布页只是起点,不是终点。