Artificial Analysis 给 DeepSeek V4 Flash 0731(max)建了一整套评测页面。九项智能测试、幻觉可靠性指数、成本效率、上下文窗口、参数规模,维度齐全。

翻遍全页,分数栏是空的。价格、参数量、具体得分,一个数字都没有。多数模型发布时,跑分和定价通常同步放出;这次框架先搭好,数据后补,顺序反过来了。

评测页测了什么

维度说明
Intelligence Index v4.19项加权测试:GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR
幻觉可靠性AA-Omniscience,-100到100分,答对加分、答错扣分、拒答不罚
成本效率按输入、缓存命中、缓存写入、推理、输出Token加权算“每任务成本”
上下文窗口 / 参数规模两条独立线:前者关系长文档和RAG,后者只在开源模型间可比

AA-Omniscience这一项值得单独说。它把“敢不敢承认不知道”也算进可靠性,而不是只看知识面广不广。这个设计比单纯拼综合分更贴近真实调用场景——一个模型乱答比不答更危险。

分数空着,说明什么

问题不在评测框架本身,而在填进去的数字还没来。框架齐全不代表结果已出,这两件事经常被混在一起说。

“Flash”这个命名本身带着速度和便宜的联想。但命名策略和真实性价比是两回事,九项测试没跑完,谁也说不清它在Intelligence Index上能排到哪一档。

材料里也没说这份评测数据会不会经DeepSeek官方确认,还是Artificial Analysis单方面测出来的。这一点原始页面没交代,不能替它补上。

对开发者和行业读者意味着什么

做模型选型和API成本预算的开发者,现在没法把V4 Flash放进对比表。该按什么价格、什么速率限制去评估,页面上没有依据。稳妥的做法是先按现有可查证的模型报价做预算,等分数和定价补齐后再补测这一项,不要因为名字里带“Flash”就假设它更快更省。

关注开源模型竞争的行业读者,可以先把这次“框架先于数据”当成一个时间线信号:评测机构愿意先占位挂出维度设置,说明它对这个模型有跟进意愿,但收录节奏和厂商发布节奏没对齐。接下来最该盯的不是模型本身,而是这个页面什么时候把分数栏填满——那才是能真正拿来比较的时间点。

命名唬得住标题,唬不住采购决策和调用账单。参数、价格、跑分不到手,DeepSeek V4 Flash 现在还只是一个占位符。