官方数字和实测数字,差了一倍多
Cerebras在推理端点目录里加了新模型qwen-3.8-27b,官方页面写着参数27B,速度约1500 tokens/秒,上下文64k(免费层)/128k(付费层),还特别声明:公开模型都是未剪枝的原始版本,只在存储层做量化,激活和KV cache全程保持全精度。
这套说辞看着很规矩。但独立的第三方推理测评把同一个模型放到Cerebras上跑了一遍,decode吞吐量只测出约663 tokens/秒,首字延迟约0.12秒——速度不到官方宣传的一半。
上下文这块也有缝。未认证状态下调用公开API,实际返回的最大上下文是65536,最大补全是32768。目录页写的付费层128k,在实测里没对上号。定价页面目前对这个模型显示输入输出都是$0,但官网免费层机制描述的是"$5额度、30天试用",零价格更像是发布期的临时促销,不是长期定价。
一个厂商在同一份文档里把峰值当日常表现来讲,不是Cerebras一家的毛病,几乎是整个推理芯片赛道的通病:跑分报的是理想工况,用户拿到的是平均工况。
模型本身的底细,和被裁掉的那部分
qwen-3.8-27b是阿里Qwen团队做的模型,27B参数,走稠密架构,不是现在流行的MoE路线。它用Gated DeltaNet和Gated Attention混合的注意力结构,原生上下文做到262144 tokens,通过RoPE/YaRN还能扩展到百万级别,协议是Apache 2.0。
对比上一代Qwen3.6-27B,这一代在代理式编程类基准上进步明显:DeepSWE从13.3到42.2,QwenSWEBench从49.3到79.0,SWE-bench Pro从53.5到61.7。这是实打实的能力提升,不该被前面的水分掩盖。
但原生262k、可扩展到1M的上下文,Cerebras公开端点只给到64k和128k两档。模型没被剪枝,权重是完整的,可用能力却被服务化的过程削掉了一大块。这才是"未剪枝"声明容易让人误读的地方——架构完整,不等于能力完整开放。
最快、最便宜、默认质量最好,是三件不同的事
跨几个推理平台看同一个模型,价格差不大,但配置差异很大。Groq默认关闭推理(reasoning off),Together默认开到最高档(xhigh)。同一个模型,不同平台默认吐出的答案质量和响应速度天然不在一个起跑线,拿默认配置直接横向比较,比的其实是平台策略,不是模型本身。
价格对比一览(每百万token,输入/输出):
| 平台 | 输入价格 | 输出价格 |
|---|---|---|
| Fireworks | $0.30 | $1.95 |
| Together | $0.33 | $2.10 |
| Groq | $0.42 | $2.55 |
| Cerebras | $0.45 | $2.70 |
Cerebras目前不是最便宜的那家,它卖的是速度。速度快不快,前面已经打了问号。
社区反馈里还有一条容易被忽略的成本:这个模型有明显的"过度思考"倾向,某些任务消耗的token量能到同类模型的五倍。单token生成得再快,总任务token量翻五倍,总账未必划算。速度和总成本,是两本账。
- 风险.官方峰值速度、宣传上下文、$0定价三项都需要用户自行复核,不能直接当生产环境预期
拿到任何速度数字之前,先问三句
天下熙熙,皆为利来——推理芯片这个赛道,卷速度、卷价格、卷营销数字,本质上跟当年显卡厂商打跑分战没什么区别。谁的峰值数字漂亮,谁就先占住用户心里"更快"的位置,至于日常工况能不能复现,往往是后话。
峰值好看,日常工况才是真账。
真正该问的三句很简单:这个速度是在什么并发和输出长度下测的?上下文限制是文档写的还是实测跑出来的?现在的价格是长期定价还是发布期促销?三句话问完,比看十份评测报告更管用。
Cerebras这次的问题不在芯片本身,晶圆级架构的吞吐量优势是真实的。问题在于,官方数字和用户能拿到的数字之间那道缝,没有被主动填上,需要用户自己拿着计算器去核实。
