DeepSeek在7月31日把V4-Flash API推入公开测试。调用方式没变,模型名还是deepseek-v4-flash。这次升级不是换了一个新模型,是同一套架构重新做了一轮post-training,主攻代码智能体和工具调用能力。
官方公布的编程类基准数字确实好看,还新增了对Responses API和Codex的原生适配。但这次升级只覆盖API,V4-Pro、APP和Web端模型都没动。官方所说"远超V4-Pro-Preview",材料里也没给出V4-Pro-Preview在同一测试下的对照分数——这句话目前只能算宣传定性,不是独立验证结论。
只重新练了一次,没换新模型
事实锚点很清楚:V4-Flash-0731和此前预览版架构、参数规模完全一致,只是重新跑了一轮post-training。
官方给出三项基准:Terminal Bench 2.1为82.7,DeepSWE为54.4,Toolathlon verified为70.3。这三项都是公开基准,不是DeepSeek关起门自己出题自己判分。
但测试用的是DeepSeek Harness minimal mode——一个还没正式发布的评测框架,配合max effort、top_p=0.95、temperature=1.0跑出来的。外部现在没法用同样条件复现这几个分数。另外DSBench-FullStack和DSBench-Hard是DeepSeek内部测试集,这两项确实没有第三方验证渠道。
历史对照可以参考2025年V3.1版本,当时Terminal-bench成绩是31.3。差距看起来很大,但两次测试的版本和评测配置不一样,不能直接拿来算进步了多少。
Codex适配比跑分数字更该关注
DeepSeek这次给V4-Flash加了对Responses API格式的原生支持,专门适配了Codex。这比跑分数字更实在——开发者可以直接用现成的Codex工作流接自己的模型,不用大改代码。
这说明DeepSeek在抢代码智能体的接入入口,不只是刷榜。但目前只有V4-Flash API做了这个升级,V4-Pro API、APP和Web端模型都还是老版本。DeepSeek只说V4-Pro正式版"随后发布",没给时间表。
价格、参数规模、延迟、上下文长度,材料里都没写。真实代码仓库的实测数据也没有——现在能看到的都是官方基准,不是生产环境的表现。
| 项目 | V4-Flash-0731(本次公测) | V4-Flash此前预览版 | V4-Pro(API/APP/Web) |
|---|---|---|---|
| 架构与参数规模 | 不变 | 不变 | 未升级 |
| 后训练 | 重新做了一轮,聚焦智能体/编程 | 原版本 | 未变 |
| Responses API/Codex原生适配 | 新增 | 无 | 未提及 |
| 发布状态 | 公开测试 | 已被取代 | 正式版"随后发布",无时间表 |
对开发者和采购方分别意味着什么
代码智能体和开发工具团队现在能做的是把V4-Flash接进测试分支,用Codex工作流跑几个真实任务——比如多文件重构、跨仓库依赖检查——看实际延迟和输出质量,而不是只看官方跑分。
企业技术负责人现阶段不用急着迁移生产环境的调用。价格、并发上限、SLA稳定性这些数字还没公开,V4-Pro正式版也没落地,批量切换的风险和收益现在都算不清楚。更现实的动作是先记录几个自己业务里必须用到的具体任务,等V4-Pro上线、第三方复现数据出来后再决定要不要迁。
轻量使用的普通API用户可以直接试切到V4-Flash-0731,调用方式没变,成本目前也看不出差异。但这不等于官方宣传的智能体能力提升,会立刻体现在你的具体场景里。
