一个号称“全球首次”的双盲 AI 评测,眼下连最基本的问题都回答不了:谁不知道模型身份,谁不知道测试内容,谁又掌握最后那张对应表?

给定材料把发布日期写成 2026 年 8 月 27 日,但只提供了标题和同名摘要,没有原始博客链接、方案正文或结果页面。若发布时尚未到该日期,这只能算待核验的页面信息;即便日期已经过去,也不能仅凭这段材料写成 DeepMind 已经证明双盲评测有效。

目前能确认的,只有一项试点宣称

现有线索可以压缩成三句话:

  • **发生了什么.**DeepMind 宣称要试点“双盲 AI 评测”。
  • **为什么重要.**它试图减少模型品牌、厂商声望和评测者预期对结果的干扰。
  • **谁会受影响.**模型开发商、第三方评测机构,以及拿榜单决定采购和产品选型的团队。

但“试点方案”“实证结果”和“全球首次”是三件事。

目前材料只支持第一层:DeepMind 提出或启动了一项试点。评测是否已经执行、结果是否公开、效果是否优于现有匿名评测,均看不清。“全球首次”也只是 DeepMind 的自我表述,没有横向检索,不能当成行业共识。

几个决定可信度的问题,材料都没有给出答案:

待核实环节双盲评测需要说清什么本次材料提供的信息
评测对象哪些模型、哪些版本,是否包含 DeepMind 自家模型未提供
任务范围推理、编程、安全、事实问答,还是人类偏好比较未提供
样本规模多少任务、多少受试者、如何抽样未提供
角色隔离模型方、评测者、受试者分别不知道什么未提供
执行机构DeepMind 自行执行,还是独立第三方负责未提供
结果披露是否公开协议、原始结果、统计方法和失败案例未提供
利益冲突谁出资、谁保管身份映射、谁有权调整流程未提供

这不是挑字眼。AI 评测里,“盲”错一个对象,整个制度就可能只剩包装。

双盲能压住品牌偏见,压不住全部偏差

在理想设计中,三类角色需要分别隔离信息。

模型方不应提前知道具体测试题、抽样顺序和评审身份,否则容易定向优化。评测者不应知道答案来自哪家公司、哪个模型版本,以免被品牌声望影响。参与偏好测试的受试者,也不应看到模型名称、价格或厂商标识。

还有一个经常被忽略的人:保管模型身份映射和随机分配规则的平台运营者。这个角色通常不可能“全盲”,因此必须受到流程隔离、日志审计和外部监督。否则偏见只是从评审桌上移到了后台。

现有 AI 评测并非完全没有匿名机制。LMSYS 发起的 Chatbot Arena,也就是后来常见的 LM Arena,会隐藏模型名称,让用户比较两组输出并投票。这能削弱品牌滤镜,但只遮住了其中一层:平台仍掌握模型映射,提示词来自用户,模型参数和版本更新也可能影响结果。

学术界的双盲同行评审同样提供了一个历史参照。作者和审稿人互不知名,可以减少名校、名人和机构声望带来的偏见,但编辑和投稿系统仍知道身份。匿名从来不是魔法,它只是把权力集中到规则制定者和信息保管者手里。

所以,双盲最多能处理几类偏差:

  • 评测者因厂商品牌产生的预期;
  • 受试者因模型名气、价格或市场口碑改变评分;
  • 模型方针对已知评委和公开题目做表面优化。

它处理不了测试集泄漏、任务分布失真、解码参数不一致、模型版本临时更新,也挡不住只公布有利结果。若 DeepMind 同时参与模型开发、方案设计、执行和发布,利益冲突依然存在,只是藏得更深。

AI 评测缺的不是新榜单,而是制度约束

我认可双盲这个方向。今天的模型榜单太容易受品牌、提示词和发布节奏影响。一个熟悉的模型名字,足以改变评审对相同答案的耐心;一家大公司的新品发布,也可能让采购团队提前接受它“理应更强”的结论。

但我不太买账的是,只靠“双盲”三个字就索取可信度。

“徒法不足以自行。”双盲只是规则名称,真正起作用的是谁执行、谁监督、谁能查账。至少要看到四样东西:

  • 完整的方法协议,包括随机化和身份隔离方式;
  • 独立监督者,以及明确的利益冲突声明;
  • 可复现的任务、模型版本和运行设置;
  • 完整结果,包括负面发现和未达预期的部分。

对 AI 研究与评测从业者,最现实的动作是暂缓把这项试点写进“已验证的评测范式”。引用时应明确标注它是厂商宣称,并追问协议是否预注册、第三方能否复跑、身份映射由谁保管。

对拿榜单做采购决策的企业团队,也不该因为“双盲”标签立刻调整候选模型。采购表里应增加几列:模型版本是否固定,任务是否贴近本公司的真实工作流,结果有没有置信区间,评测方是否接受厂商资金,原始样本能否审计。缺一项,分数就该打折。

真正的分水岭,不会是 DeepMind 能否造出一个新名词,而是它是否愿意把评测权关进制度的笼子里。等方法、样本、执行方和复现入口出现后,这项试点才有资格被讨论成标准;在此之前,它更像一张尚未兑现的信用凭证。