Fireworks Research 最近上线了一个让人有些意外的专用模型 Ember-1。它的底座是月之暗面的主力推理模型 Kimi K3,参数量依旧是庞大的 2.78T MoE 架构,API 的每百万 Token 输出标价也依然维持在 15 美元,分文未降。官方宣称它能在保持基模解题能力的前提下,直接砍掉约 40% 的生成 Token。

在同行普遍用打折、降配或蒸馏小模型来降低使用门槛时,Ember-1 走了一条完全相反的工程路径。它不缩减参数,也不搞低价倾销,而是直接对推理模型冗长的自我思考过程动刀。

多轮智能体的二次方反刍危机

自从长思维链技术在复杂编程中普及以来,推理模型就患上了一种自言自语的慢性病。为了答对一道复杂的工程难题,模型经常要消耗数千甚至上万个内部思考 Token,在很多请求里,真正的有效代码只占一成,其余 90% 都在自我推演。

单次请求耗时长一点还可以容忍,但在当下主流的多轮编程智能体工作流里,这演变成了一场账单灾难。在代码生成与环境调试的循环交互中,智能体每一轮都会把上一轮完整的思考轨迹重新塞回输入上下文。上下文由此呈现二次方级别膨胀,每一次细微的代码微调,都在为前几轮已经失效的自我反思反复埋单。

许多开发者此前试图通过调低思考力度参数来压低消耗,结果往往是模型推理能力断崖式下跌。单纯让模型少想一点,等于让它强行交卷,错误率立刻飙升。

多轮智能体的上下文通胀机制对比 常规推理模型:思考历史反刍 第 1 轮:任务提示 + 冗长自省 (40K) 第 2 轮:重新读入首轮全量思考 (二次方计费) 后果:上下文迅速跑满,输出成本不可控 Ember-1 方案:后训练思维剪枝 剔除死循环与伪反思,压缩思考链路 多轮交互只回传高价值推理决策点 结果:总生成缩减约 40%,抑制历史膨胀

2.78T 参数不缩水,后训练剪掉了什么

Fireworks 在其 Serverless Training 平台上进行了 50 多次训练实验与 200 多次系统评估,摸索出的逻辑是通过环境任务反馈进行定向剪枝。他们没有动底层骨干网络,而是惩罚那些在推理链路中原地打转的无效死循环与过度自我怀疑。

Ember-1 保留了 Kimi K3 完整的系统规格:约 1.04M Token 的上下文窗口,兼容图像输入与函数调用。它的计费规则也与基模完全一致,未缓存输入每百万 Token 标价 3 美元,缓存输入为 0.30 美元,输出则为 15 美元。

根据内部编程评测,模型的平均输出 Token 从原本的 49.3K 压缩到了 29.9K,其中思考 Token 缩减了 71.3%,总输出降幅达到 39%,而任务评分基本持平在 0.753 对比 0.751。在两家真实客户的生产环境灰度测试里,任务整体 Token 消耗降低了约 35%。第三方网关监测显示其运行时约有 0.5 秒首字延迟与 142 tokens/s 的吞吐速率。

Ember-1 核心工程指标变化 -71.3% 思考 Token 缩减 -39% 总输出 Token 下降 2.78T 保留原版 MoE 规模 $15/M 输出单价完全持平
推理模型的价值不在于自言自语了多少行,而在于多快能给出没有漏洞的行动方案。

剪枝并非无损,跑分分歧下的现实取舍

把思考链路抽脂之后,模型并没有在所有测试集上全面获胜。仔细比对官方公布的测试成绩,能清晰看到这种剪枝策略带来的性能分化。

在偏向环境交互的测试中,Ember-1 表现抢眼。DeepSWE 1.1 基准上,它的准确率从 K3 Max 的 66.4% 大幅跃升至 75.2%,单任务测试成本下降了 23.7%;在 Terminal-Bench 2.1 上也从 80.9% 升至 82.0%,调用成本更是腰斩了 51.9%。甚至在包含 500 例临床医学案例的 Bedside Bench 上,Fireworks 宣称其成本效益线跨越了 GPT-5.6 Sol、GPT-6 Astra 与 Claude Opus 5 构成的帕累托边界。

但在极其依赖深度推理边界的基准上,代价随之浮现。在严苛的 SWE-bench Verified 评测中,Ember-1 得分为 92.2%,相比原版 K3 Max 的 93.2% 微跌了 1 个百分点;在 SWE-Interact 上也从 21.3% 滑落至 20.0%。而在业务逻辑相对单一的 τ²-Bench Airline 基准上,其准确率虽从 64% 微升至 66%,但 Token 节约幅度仅有 5.9%。

  • 风险.静态疑难排错非常依赖长思维链的穷举搜索,思维截断会直接牺牲边缘长尾缺陷的定位概率。

这说明所谓的高效思考是有适用边界的。动态交互任务需要模型果断尝试并根据报错快速调整,精简思考能有效避免它陷入逻辑死结;但在复杂的冷启动单次代码修复中,被剪掉的那些冗长自问自答,恰恰可能包含解开死局的关键线索。

基准测试项目样本量 (N)K3 Max 准确率Ember-1 准确率报告成本降幅 / 差额
DeepSWE 1.111366.4%75.2%-23.7% (-$126.90)
Terminal-Bench 2.18980.9%82.0%-51.9% (-$23.10)
SWE-bench Verified50093.2%92.2%-15.5% (-$68.10)
SWE-Interact7521.3%20.0%-32.5% (-$60.80)
τ²-Bench Airline5064.0%66.0%-5.9% (-$0.30)

15 美元单价下的算力账本

评估 Ember-1 的经济性,必须拆解真实的企业工作流。眼下的模型市场正在经历残酷的价格战,Qwen3.8-Max 的输出单价已经拉低至每百万 Token 6 美元,DeepSeek V4.1-Flash 的闲时输出单价甚至压到了 0.60 美元。面对这些竞品,Ember-1 维持 15 美元的输出定价,依靠的完全是每任务实际 Token 消耗的收敛。

这也意味着它的降本效果高度依赖上下文结构。如果企业工作流属于输入密集型,例如单次请求塞入数万行业务代码却只要求返回几行修改,其主要开销落在输入端,Ember-1 的省钱效果会大打折扣。只有当系统处于高频自主排错、工具连续调用的多轮交互回路中,抑制思考冗余带来的复利才会显现。

  • 建议.多轮执行且思考占比畸高的智能体可立即替换测试,但纯检索阅读为主的重输入业务无需跟进。

《淮南子》讲“事莫明于有效,论莫定于有证”。目前 Ember-1 的所有对比数据均来自 Fireworks 官方披露,社区与第三方尚未完成全套基准的独立复现,其底层是否依然保留了 Kimi K3 偶发的指令遵循偏移,也需要更多生产环境检验。但它的出现至少敲掉了一个行业思维定势:当大家都在比拼谁的思维链更长、谁更能长篇大论时,如何让大参数模型学会适时闭嘴,已经成了更具工业价值的真实命题。