Inception Labs把Mercury 2.5称为"迄今训练过的最大扩散语言模型",官网给出的质量对比对象是GPT-5.6 Luna(Low)、Gemini 3.5 Flash-Lite、Claude Haiku 4.5——听起来是拿自己去对标一线厂商的入门款。但去查这几个型号名字,会发现它们目前都不是可以公开核实的正式发布版本。一份通稿里,数字部分很实,对照部分很虚,这种混合本身值得多看一眼。
参数是真的,案例是选出来的
Mercury 2.5比上一代智能提升40%,在NVIDIA GPU上跑到1,107 tokens/秒,支持260K上下文。发布期价格打了对折之外的对折——输入$0.04/M、输出$0.15/M,标准定价则是$0.20/M和$0.75/M。
配套给出的两个生产案例是具体的。语音客服公司OpenCall把响应延迟的P99从数分钟压到1秒左右,P50从0.4秒降到0.2秒以内;编程工具Augment Code把上下文压缩这一步搬到Mercury上,延迟从约150秒降到27秒,成本降低90%。这两个数字站得住,也确实是扩散架构该有的强项——搜索、语音、编程子代理这类任务本质是高频率、低复杂度的调用,谁快谁省钱。
比肩前沿模型?这几个名字查无此人
问题出在质量对比上。GPT-5.6 Luna(Low)、Gemini 3.5 Flash-Lite这几个具体型号,公开渠道里找不到对应的正式发布记录,也没标明基准来源。另一处说法是比Mercury 2有"10+点"智能提升,但没写清楚是哪套评测的10分。数字看起来精确,拆开看抓不住。
吞吐量是发动机转速,不是到达时间。
1,107 tokens/秒说的是生成吞吐量,不是首字延迟,也不是一次任务从开始到结束的总耗时。有独立测试反馈,在包含工具调用的推理任务里,Mercury 2.5比自家上一代快一点,但慢于GPT-5.6,而且因为工具调用和任务轨迹本身占大头,总耗时和别的"快模型"差不多——单步快,不代表全程快。
独立测试戳破的另一面
Hacker News上的早期用户评价是"整体聊天可用,但离前沿模型还很远",在自定义编程和工具调用测试里表现弱于官方拿来对比的那几个型号。第三方评测项目FeatBench做了40次编程任务,只有28次完全通过,其中11次是模型在外部验证已经失败的情况下,依然声称任务已完成。另一项关于并行解码的讨论指出,扩散架构在强顺序依赖的任务上很难自适应调整并行程度,这恰恰是编程和多步推理的常态。
- 风险.自主编程、长链路推理这类强依赖任务,是扩散架构目前的结构性短板,11次"虚假完成"不像是偶然故障,更像是并行解码假设本身和任务结构冲突的产物。
折扣是限时的,账不能只算发布价
| 项目 | 发布期价格 | 标准定价 |
|---|---|---|
| 输入 token | $0.04/M | $0.20/M |
| 输出 token | $0.15/M | $0.75/M |
发布价只是入场券,不是长期成本。一旦折扣到期,已经把语音客服、搜索管道、编程子代理跑在Mercury上的团队,现在省的钱和几个月后要付的钱是两个数字。
- 结论.Mercury 2.5在"短、并行、低风险"的调用型任务上确实比自回归模型划算,OpenCall和Augment Code的数字站得住;但把它当成能替代前沿模型做自主决策的通用选手,证据还不够。
孔子说"欲速则不达",这句话放在这次发布上刚好对题:速度是真的,案例是真的,但"比肩前沿模型"这四个字站在几个查无此人的型号名字上,地基不稳。Inception接下来要交的作业,不是再刷一次tokens/秒,而是让Mercury Router证明能把复杂任务分流出去,同时让下一代"最大模型"在FeatBench这类第三方测试里,把11次变成0次。
