DeepSeek在7月31日把V4-Flash API推入公开测试。调用方式没变,模型名还是deepseek-v4-flash。这次升级不是换了一个新模型,是同一套架构重新做了一轮post-training,主攻代码智能体和工具调用能力。

官方公布的编程类基准数字确实好看,还新增了对Responses API和Codex的原生适配。但这次升级只覆盖API,V4-Pro、APP和Web端模型都没动。官方所说"远超V4-Pro-Preview",材料里也没给出V4-Pro-Preview在同一测试下的对照分数——这句话目前只能算宣传定性,不是独立验证结论。

只重新练了一次,没换新模型

事实锚点很清楚:V4-Flash-0731和此前预览版架构、参数规模完全一致,只是重新跑了一轮post-training。

官方给出三项基准:Terminal Bench 2.1为82.7,DeepSWE为54.4,Toolathlon verified为70.3。这三项都是公开基准,不是DeepSeek关起门自己出题自己判分。

但测试用的是DeepSeek Harness minimal mode——一个还没正式发布的评测框架,配合max effort、top_p=0.95、temperature=1.0跑出来的。外部现在没法用同样条件复现这几个分数。另外DSBench-FullStack和DSBench-Hard是DeepSeek内部测试集,这两项确实没有第三方验证渠道。

历史对照可以参考2025年V3.1版本,当时Terminal-bench成绩是31.3。差距看起来很大,但两次测试的版本和评测配置不一样,不能直接拿来算进步了多少。

DeepSeek 官方基准(公开基准,运行环境未公开) 82.7 Terminal Bench 2.1 公开基准 54.4 DeepSWE 公开基准 70.3 Toolathlon verified 公开基准 注:三项均为公开基准,但使用未发布的Harness minimal mode测得,外部暂无法复现;DSBench系列为内部测试集,同样缺第三方验证

Codex适配比跑分数字更该关注

DeepSeek这次给V4-Flash加了对Responses API格式的原生支持,专门适配了Codex。这比跑分数字更实在——开发者可以直接用现成的Codex工作流接自己的模型,不用大改代码。

这说明DeepSeek在抢代码智能体的接入入口,不只是刷榜。但目前只有V4-Flash API做了这个升级,V4-Pro API、APP和Web端模型都还是老版本。DeepSeek只说V4-Pro正式版"随后发布",没给时间表。

价格、参数规模、延迟、上下文长度,材料里都没写。真实代码仓库的实测数据也没有——现在能看到的都是官方基准,不是生产环境的表现。

项目V4-Flash-0731(本次公测)V4-Flash此前预览版V4-Pro(API/APP/Web)
架构与参数规模不变不变未升级
后训练重新做了一轮,聚焦智能体/编程原版本未变
Responses API/Codex原生适配新增未提及
发布状态公开测试已被取代正式版"随后发布",无时间表

对开发者和采购方分别意味着什么

代码智能体和开发工具团队现在能做的是把V4-Flash接进测试分支,用Codex工作流跑几个真实任务——比如多文件重构、跨仓库依赖检查——看实际延迟和输出质量,而不是只看官方跑分。

企业技术负责人现阶段不用急着迁移生产环境的调用。价格、并发上限、SLA稳定性这些数字还没公开,V4-Pro正式版也没落地,批量切换的风险和收益现在都算不清楚。更现实的动作是先记录几个自己业务里必须用到的具体任务,等V4-Pro上线、第三方复现数据出来后再决定要不要迁。

轻量使用的普通API用户可以直接试切到V4-Flash-0731,调用方式没变,成本目前也看不出差异。但这不等于官方宣传的智能体能力提升,会立刻体现在你的具体场景里。