文档智能平台 Datalab 在 2026 年秋季拿出了号称终结行业偏见的抽取基准 OmniExtractBench,试图用开源数据集与确定性算法,为混乱的 PDF 结构化抽取立一套标准规矩。在这张官方发布的排行榜上,Datalab 自研方案以 93.85% 和 93.48% 的准确率包揽前两名,将主流通用大模型与同赛道对手尽数甩在身后。

然而,开源代码与确定性评分并未带来预想中的公信力。当 LlamaIndex 团队在 GitHub 代码仓库提交补丁,证明官方适配器擅自剥离了 Schema 中的合法空值声明、导致模型平白被判为数据伪造后,其实际成绩在修复后直接飙升近 8.5 个百分点。这一戏剧性反转撕开了一个行业盲区:即便测试集与核心算分逻辑完全透明,评测组织者依然能通过外围适配器陷阱和统计口径裁剪,合规地压制竞品。

裁判员自设的擂台与自研登顶的榜单

企业级文档智能的工程选型长期受困于评测工具的错位。过去衡量问答能力的 DocVQA 依赖文本相似度指标 ANLS,衡量版面还原的 OmniDocBench 关注 TEDS 与编辑距离,两者都无法评估核心业务场景:把复杂的嵌套 PDF 稳定还原为符合 JSON Schema 的多行表格与结构化数值。缺乏中立公开标尺的结果,是各家方案都拿私有测试集自封第一。

620 份基准测试文档被置于刻有严密对齐规则的标尺之下(示意图)
620 份基准测试文档被置于刻有严密对齐规则的标尺之下(示意图)

OmniExtractBench 正是踩着这一痛点登场。该基准基于 Apache-2.0 协议开源,明确测试任务为“PDF 加 JSON Schema 生成结构化数值”,涵盖 4 个源测试套件共 620 份文档。评分机制也颇具说服力,采用基于内容的数组行对齐算法,细致切分错误值、缺失值、伪造值、多余行与未声明字段,并且空值不计入匹配分。

OmniExtractBench 官方首发榜单与有效处理样本量 模型方案 官方公布准确率 有效样本 (总数 620) Datalab accurate 93.85% 620 / 620 Reducto deep_extract v2 93.47% 620 / 620 Claude opus 5 90.96% 575 / 620 (漏 45) Gemini 3.7-flash 86.79% 526 / 620 (漏 94) LlamaExtract (初始) 84.93% 620 / 620 GPT 5.6-sol 83.85% 620 / 620 Azure CU gpt-4.1-mini 61.08% 569 / 620 (漏 51)

但在首发榜单上,主场作战的 Datalab accurate(93.85%)与 Datalab balanced(93.48%)稳居前两位,紧随其后的是 Reducto deep_extract v2 的 93.47%。相比之下,通用旗舰 Claude opus 5 录得 90.96%,Extend 为 90.17%,Gemini 3.7-flash 仅有 86.79%,而 LlamaExtract agentic_plus 更是只有 84.93%,Mistral OCR 4.1 和 Azure CU gpt-4.1-mini 则分别滑落至 76.78% 和 61.08%。自研方案全面压制通用巨头的跑分,迅速在文档工程圈引发讨论。

一行适配器代码引发的 8.5% 跃升

传统视角认为,基准测试的貓腻无非是偷换闭源测试集或硬编码过拟合。OmniExtractBench 展现了一种隐蔽得多的手法:核心打分器是纯粹的数学对齐,但连接竞品接口的适配层代码却动了手脚。

负责连接外部接口的转接头被折断了关键引脚,导致数据无法正常回传(剖面示意)
负责连接外部接口的转接头被折断了关键引脚,导致数据无法正常回传(剖面示意)
决定排行榜名次的往往不是模型能力,而是主办方写在外围的格式转换代码。

在项目 GitHub 仓库的 PR #11 中,LlamaIndex 贡献者指出了一个关键结构漏洞:评测框架在调用 LlamaExtract 前,适配器内部逻辑粗暴移除了 Schema 中合法的 null 选项。面对文档中原本就不存在的非必填字段,模型因无法输出 null,被迫填入推测数据,随即被后端的确定性评分器判定为伪造数据(fabricated values)并扣除重分。

PR #11 揭示的适配器致偏链条 原始输入 • PDF 文档 • 业务 Schema (含合法 null 字段) 官方适配器 (预处理) • 转换竞品请求格式 • 过滤剥离 null 声明 模型丧失留空能力 模型输出 缺失字段被迫 填充占位字符 触发虚假填充 评分器 判定伪造 惩罚扣分 分值暴跌

当贡献者修正适配器代码并更新了 423 份文档的 Schema 定义后,LlamaExtract 的实际测试准确率从 85.46% 跃升至 93.94%,直接追平并微弱反超了榜首的自研产品。面对实锤代码证据,Datalab 维护者随后合并了 PR #17,通过追溯调整占位符判定,将 LlamaExtract 的记录调整至 87.94%。但在前端公开榜单上,数据仍长期停留在不利于竞品的 84.93%。

这种偏差很难简单归咎于疏忽。当适配层掌握在单一厂商手中时,开发者只要对竞品的数据契约做哪怕微小的负向预处理,就足以在最终排行上制造出跨梯队的虚假差距。


消失的分母与缺失的账单

适配器偏差只是冰山一角,OmniExtractBench 在统计口径上的剪裁同样耐人寻味。其公布的准确率并不是全量样本的端到端通过率,而仅仅是成功处理文档的平均分,所有超时与报错样本均未按零分计入。

测试样本矩阵中未能跑通的 94 个坏块被整齐剪除,未纳入均分统计(示意图)
测试样本矩阵中未能跑通的 94 个坏块被整齐剪除,未纳入均分统计(示意图)

从文档覆盖度来看,这一统计魔术直接扭曲了可用性结论:

  • Gemini 3.7-flash 在 620 份文档中仅处理了 526 份,意味着有近 15% 的高难度样本直接在算分阶段蒸发;
  • Claude opus 5 漏掉了 45 份,Azure CU 漏掉了 51 份;
  • 与之相对,Datalab 自研模型与 LlamaExtract 均硬抗处理了全部 620 份。

如果将崩溃和超时视为业务事故按零分折算,依赖大量未跑通样本刷高均分的系统名次将面临断崖式下坠。更值得关注的是,测试集中的 620 份文档有 202 份由 Datalab 内部程序合成生成,占比达到 32.6%。尽管拉入了第三方套件,三成以上的自产题库依然给既是选手又是出题人的平台留足了空间。

  • 风险.目前的基准测试完全剥离了美元成本与 P95 延迟跑分。企业若单凭纸面准确率选型,在真实业务中极可能遭遇数倍的 API 账单溢价或长达数十秒的端到端等待。

不仅如此,由于复现该评测必须由用户自行配置并消耗各家昂贵的付费商用 API 额度,普通开发者难以低成本跑完全量对照。对于技术选型团队而言,不能将脱离了每千页调用成本、真实吞吐延迟与错误惩罚机制的开源准确率排行榜当作采购指南;在没有中立机构接入前,厂商自制的评测即便顶着开源之名,也应当先审视其适配器里到底改动了什么。