官方数字和实测数字,差了一倍多

Cerebras在推理端点目录里加了新模型qwen-3.8-27b,官方页面写着参数27B,速度约1500 tokens/秒,上下文64k(免费层)/128k(付费层),还特别声明:公开模型都是未剪枝的原始版本,只在存储层做量化,激活和KV cache全程保持全精度。

这套说辞看着很规矩。但独立的第三方推理测评把同一个模型放到Cerebras上跑了一遍,decode吞吐量只测出约663 tokens/秒,首字延迟约0.12秒——速度不到官方宣传的一半。

吞吐量:宣传 vs 实测 1500 官方宣传 tok/s 663 第三方实测 tok/s

上下文这块也有缝。未认证状态下调用公开API,实际返回的最大上下文是65536,最大补全是32768。目录页写的付费层128k,在实测里没对上号。定价页面目前对这个模型显示输入输出都是$0,但官网免费层机制描述的是"$5额度、30天试用",零价格更像是发布期的临时促销,不是长期定价。

一个厂商在同一份文档里把峰值当日常表现来讲,不是Cerebras一家的毛病,几乎是整个推理芯片赛道的通病:跑分报的是理想工况,用户拿到的是平均工况。

模型本身的底细,和被裁掉的那部分

qwen-3.8-27b是阿里Qwen团队做的模型,27B参数,走稠密架构,不是现在流行的MoE路线。它用Gated DeltaNet和Gated Attention混合的注意力结构,原生上下文做到262144 tokens,通过RoPE/YaRN还能扩展到百万级别,协议是Apache 2.0。

对比上一代Qwen3.6-27B,这一代在代理式编程类基准上进步明显:DeepSWE从13.3到42.2,QwenSWEBench从49.3到79.0,SWE-bench Pro从53.5到61.7。这是实打实的能力提升,不该被前面的水分掩盖。

但原生262k、可扩展到1M的上下文,Cerebras公开端点只给到64k和128k两档。模型没被剪枝,权重是完整的,可用能力却被服务化的过程削掉了一大块。这才是"未剪枝"声明容易让人误读的地方——架构完整,不等于能力完整开放。

上下文:模型能到 vs 用户能用 模型原生上限:262144,可扩展至百万级 Qwen团队公开的架构能力 Cerebras目录声明:128k(付费层) 文档写的托管上限 API实测返回:65536 未认证调用实际拿到的窗口

最快、最便宜、默认质量最好,是三件不同的事

跨几个推理平台看同一个模型,价格差不大,但配置差异很大。Groq默认关闭推理(reasoning off),Together默认开到最高档(xhigh)。同一个模型,不同平台默认吐出的答案质量和响应速度天然不在一个起跑线,拿默认配置直接横向比较,比的其实是平台策略,不是模型本身。

价格对比一览(每百万token,输入/输出):

平台输入价格输出价格
Fireworks$0.30$1.95
Together$0.33$2.10
Groq$0.42$2.55
Cerebras$0.45$2.70

Cerebras目前不是最便宜的那家,它卖的是速度。速度快不快,前面已经打了问号。

社区反馈里还有一条容易被忽略的成本:这个模型有明显的"过度思考"倾向,某些任务消耗的token量能到同类模型的五倍。单token生成得再快,总任务token量翻五倍,总账未必划算。速度和总成本,是两本账。

  • 风险.官方峰值速度、宣传上下文、$0定价三项都需要用户自行复核,不能直接当生产环境预期

拿到任何速度数字之前,先问三句

天下熙熙,皆为利来——推理芯片这个赛道,卷速度、卷价格、卷营销数字,本质上跟当年显卡厂商打跑分战没什么区别。谁的峰值数字漂亮,谁就先占住用户心里"更快"的位置,至于日常工况能不能复现,往往是后话。

峰值好看,日常工况才是真账。

真正该问的三句很简单:这个速度是在什么并发和输出长度下测的?上下文限制是文档写的还是实测跑出来的?现在的价格是长期定价还是发布期促销?三句话问完,比看十份评测报告更管用。

Cerebras这次的问题不在芯片本身,晶圆级架构的吞吐量优势是真实的。问题在于,官方数字和用户能拿到的数字之间那道缝,没有被主动填上,需要用户自己拿着计算器去核实。