一款3040亿参数、Hugging Face文件约167GB的模型,在Artificial Analysis榜单上压过了4280亿参数的MiniMax M3。更扎眼的是价格:原始材料给出的报价为每百万输入Token 0.14美元、输出Token 0.27美元。
DeepSeek V4 Flash 0731因此被推到“单位智能成本”曲线的前排。可同一份测试记录里,默认推理档生成的“鹈鹕骑自行车”明显失真;把reasoning_effort调到high,结果才像样起来。
便宜和好用,在这里还差一张真实账单。
榜单给了它一张入场券
DeepSeek将V4 Flash 0731描述为V4系列的最新版本,并称其智能体能力有大幅增强。公开材料里的几个关键信息,可以压缩成这张表:
| 观察项 | 已知信息 | 目前不能推出的结论 |
|---|---|---|
| 模型规模 | 3040亿参数,Hugging Face文件约167GB | 参数少于对手,不等于所有任务都更高效 |
| 横向排名 | Artificial Analysis将其排在4280亿参数的MiniMax M3之前 | 综合指数领先,不代表每类任务都领先 |
| 报价 | 每百万输入Token 0.14美元,输出Token 0.27美元 | 原始材料未说明是否为官方直供价,也未交代地区、缓存和中转加价 |
| 绘图测试 | 默认推理档较差,高推理档明显改善 | 单次SVG任务不能证明整体质量稳定或不稳定 |
| 产品主张 | 强调更强的智能体能力 | 仍需代码执行、工具调用和长链任务验证 |
这组信息真正有分量的地方,不是“又多了一个大模型”,而是DeepSeek继续把能力压到更低的价格区间。Artificial Analysis的成本—智能指数散点图中,它位于低成本、高得分区域,甚至靠近帕累托前沿。
这会直接影响两类人。
独立开发者会把它加入模型路由和批处理任务的候选名单。预算紧张的团队也会重新计算:摘要、分类、代码辅助和轻量智能体,是否还需要默认调用更贵的模型。
但榜单只能帮模型进候选池,不能替采购和开发团队签字。综合分数会压平任务差异;同一个模型做代码修改、工具调用、中文写作和视觉生成,表现可能完全不是一回事。
高推理档可能改写成本账
原始测试通过OpenRouter调用模型。默认推理档下,鹈鹕、自行车和肢体关系都有明显错误;切换到高推理档后,构图和对象关系改善很多。
这段测试很有启发,但证据边界也很清楚:它只能说明推理配置会影响结果,不能据此判定模型默认档“质量不稳”。一次绘图任务更像烟雾报警器,不是质量鉴定书。
真正需要补齐的是三组数字:
| 变量 | 为什么要测 | 建议记录 |
|---|---|---|
| Token消耗 | 高推理档可能生成更多推理Token | 输入、可见输出、隐藏推理Token及其计费口径 |
| 延迟 | 更深推理通常意味着等待更久 | 首Token时间、完整响应时间、并发下降幅度 |
| 任务成功率 | 单次成功容易被偶然性放大 | 固定题集、多轮重复、人工验收和失败重试次数 |
按材料中的单价,基础成本公式并不复杂:
成本 = 输入Token ÷ 1,000,000 × 0.14美元 + 输出Token ÷ 1,000,000 × 0.27美元
麻烦在于,high档究竟多消耗多少Token、推理Token是否按相同口径收费、OpenRouter报价与DeepSeek官方接口是否一致,现有材料没有交代。只报“每百万Token价格”,却不报完成同一任务要花多少Token,很容易把便宜算成一种幻觉。
云计算早期也经历过类似阶段。厂商都在比每小时单价,企业真正迁移后才发现,存储、带宽、运维和稳定性共同决定总成本。今天的大模型计价不完全一样,但旧账本上的教训仍然有效:单价只是门票,完成任务的总成本才是结算价。
该测的不是鹈鹕,而是生产任务
我不太买账“性价比冠军”这种过早的称号。现有证据足以说明V4 Flash很有竞争力,也足以让团队安排测试;还不足以证明它在真实业务里最省钱。
如果你正在做模型选型,最现实的动作不是立刻迁移,而是拿现有生产任务跑一轮A/B测试:
- 默认档和高推理档分别测试,不混用结果。
- 固定服务商、温度、上下文长度和重试策略。
- 记录每个成功任务的总Token、延迟和价格。
- 单独统计工具调用失败、格式错误和人工返工。
- 核对官方API、OpenRouter等中转渠道的模型版本与报价。
判断是否迁移,可以盯住一个更硬的指标:每个合格结果的成本。模型单价再低,只要失败重试和人工修正增加,省下的钱很快就会被吃掉。反过来,如果高推理档仍能维持明显的成本优势,且智能体任务成功率接近更贵模型,那才是V4 Flash真正改变市场的位置。
“天下熙熙,皆为利来。”模型厂商争榜单,平台争流量,开发者只该认最终账单。DeepSeek这次已经把价格压力递给了同行;它能不能把用户也留下,要看高推理档的成本、延迟和稳定性是否经得起批量复测。
