一张来自ARC Prize官网的成绩页显示,DeepSeek V4 Flash 0731在ARC-AGI-1半私有测试集上拿到89.0%,每道题成本仅0.02美元;在难度更高的ARC-AGI-2上是61.4%,成本0.04美元。页面挂着“ARC Prize Verified”认证标识,还附了论文链接和Hugging Face模型地址。乍一看,这是低成本推理模型在最难抓的抽象推理基准上的一次漂亮胜利。
但有一件事很奇怪:DeepSeek自己7月31日的发布通稿里,完全没提这项成绩。
官方通稿为什么不提最亮眼的分数
那天DeepSeek主推的是一串Agent和代码类基准——Terminal-Bench 2.1、DeepSWE、CyberGym、AutomationBench之类。ARC-AGI一个字都没出现。
这不太符合常理。如果一家公司真的在ARC-AGI-2这种以“抗记忆、抗刷题”著称的高难度基准上拿到61.4%,还打出全行业最低的推理成本,这几乎是能单独开一篇通稿的亮点,没有理由藏着不说。厂商通稿里的“该说而未说”,往往比说了什么更值得追问。
- 风险.一份成绩单如果只在第三方页面出现,而厂商自身完全不引用,读者应该先假设它未经确认,而不是先假设它是真的。
三方证词互相打架,核验本身成了问题
更麻烦的是,想去确认这个页面和条目是否真实存在,得到的答案是分裂的。有人怀疑“DeepSeek V4 Flash 0731”这个命名本身有问题——版本号像DeepSeek的习惯,“Flash”却更像Google的品牌词,两种命名习惯拼在一起,容易让人怀疑是被混用或误抓取的孤立条目。也有人查不到这个条目仍挂在当前排行榜上。
支撑这个分数的论文编号(arXiv 2606.19348)对应的投稿时间和7月31日的发布日期在逻辑上能对上,但论文本身的存在性和内容尚未被独立确认。换句话说,连试图核实这件事的工具本身,都给不出一致的结论。这比“分数是假的”更值得记录——它说明面对一个看似权威却未被广泛索引的页面,现在的信息核验能力同样容易翻车。
一个连核查工具都吵不清真假的分数,本身就是一种警示信号
旁证:同期其他成绩也有复现问题
抛开ARC-AGI真假不谈,DeepSeek同一批发布的其他明星数据也不干净。官方称Terminal-Bench 2.1拿了82.7%,但独立机构此前对早期版本用不同Agent框架测出的分数只有66.4%左右。支撑这些成绩的“DeepSeek Harness”尚未开源,第三方目前无法完整复现系统级结果。多个OpenRouter第三方provider在渲染推理强度设置时也出过错,把“max”档误当成“high”档跑,导致跨平台的分数根本不能直接比较。
这套“厂商自证、第三方难复现”的模式,不是DeepSeek一家的问题,是当下AI跑分生态的通病。ARC-AGI之所以被设计成Public/Semi-Private/Private三层测试集,本意就是防止模型靠“记住答案”而不是“真的推理”拿高分——公开集的题目和解法已经有被爬进训练语料的风险。原文标注这次是Semi-Private集的成绩,理论上污染风险更低,但至今没有第三方独立复测能佐证这一点。
谁该盯着,接下来看什么
结论:如果这份89.0%成绩最终被证实为真,意味着推理成本和推理能力的曲线又被压低一档,会给OpenAI、Google、Anthropic等高成本路线的模型定价带来压力,也会强化DeepSeek“低价高质”的市场叙事。反过来,如果它被证实是命名混淆或数据造假,伤害的不只是DeepSeek的信誉,还有ARC Prize“Verified”标识本身的权威性——这套认证的价值,就建立在“挂了认证就一定可信”这个假设上。
对开发者和企业采购方来说,眼下最现实的动作是:先别把这张成绩单当作选型依据。等ARC Prize官方公开确认或撤下条目,等DeepSeek就此发一份说明,等“DeepSeek Harness”真的开源到能被第三方复现,这几件事任何一个真的落地,这份分数的可信度才算立住。
