OpenAI这次拿出的成绩单,第一眼很吓人:在公开推理基准InferenceX上,跟英伟达GB200系统比,某个操作点上的吞吐效率差了53.7倍。这个数字够炸,但拆开看,炸得不太讲道理——它比的不是同一条起跑线,而是两台机器各自跑到自己最舒服区间时的结果。OpenAI官方博客只说了一句"delivered more peak throughput per kilowatt and lower token latency",没给具体数字,把口径差异藏在了公关辞令后面。
拆开这张成绩单
具体数字并不难找。针对GPT-OSS 120B模型,Jalapeño峰值混合吞吐达到85,448 TPS/kW,对比系统44,960 TPS/kW,约1.9倍。端到端延迟1.03秒对1.80秒,约1.7倍更低。最小TBT指标上,Jalapeño是0.69毫秒,对比系统1.87毫秒,约2.7倍,对应每用户生成速率1,459 tok/s对535 tok/s。
在DeepSeek R1和Kimi K2.5上,Jalapeño同样拿到1.5到1.9倍的能效优势、1.7到3.6倍的延迟优势——说明这不是单一模型的运气,是跨模型的一致表现。
真正制造话题的是那个53.7倍:拿Jalapeño自己的峰值吞吐(22,935 TPS/kW),去对比GB200在"此前TBT操作点"上的表现(427 TPS/kW)。两边根本不在同一个工作区间,这本质是一次操作点错位比较,不是峰值对峰值的整体性能倍数。
每千瓦这个单位,藏着一个假设
功耗归一化用的是芯片封装的公开TDP额定值:Jalapeño 700W,GB200 1200W。TDP是厂商标注的最大功耗上限,不等于实测整机能耗。OpenAI自己也提到,Jalapeño在测试负载下实测持续功耗大概在550W以下——如果真按实测功耗折算能效比,分母会变,倍数也会跟着变。用标称TDP做分母,等于选了一个对自己更有利、也更保守的数字,却没告诉读者还有另一种算法。
GB200那一侧,实测功耗是多少,文章没提。
再加上对比对象只有GB200一款系统,没跟英伟达更新一代产品比,也没跟同行的其他推理芯片比。单一对比对象,加上自测自报,这份成绩单更像一份内部PPT,还不到可以直接拿去做行业结论的地步。
- 风险.全部数据来自OpenAI自测,没有第三方复现或独立审计,含金量要打折。
数字好看是真的,账本干净是假的。
一边自研,一边继续买英伟达
有意思的是,OpenAI并不打算靠Jalapeño取代英伟达。原文写得很直白:"build for breadth, own for leverage"——供应商名单里除了Microsoft和NVIDIA,还挂着AWS、AMD、Broadcom、Cerebras、CoreWeave、Oracle、SB Energy、SoftBank共八家。自研芯片不是要退出这盘牌局,是给自己加一张能上桌议价的牌。
- 结论.自研芯片的真正作用不是替代英伟达,是拿到议价权。
这跟Google做TPU、Amazon做Trainium、Microsoft做Maia、Meta做MTIA是同一套逻辑:自己手里有一款能跑的芯片,买英伟达的时候才有资格谈价格,而不是被单一供应商牵着走。英伟达的护城河短期内没被真正撬动——它仍是OpenAI最重要的合作方之一——但护城河的水位,确实在一点点往下降。
Jevons paradox这张牌,是讲给谁听的
原文最后落到"Jevons paradox"上:效率提升不会让公司少花钱,只会让公司做更多事——审更多合同、跑更多财务模拟、测更多工程方案。这套叙事真正的听众是投资人,不是用户,意思是"我们效率越高,你们该投的钱不是更少,是更多"。历史上每一轮基础设施扩张的说辞都差不多——铁路便宜了,货运量反而暴涨;电价降了,用电设备反而铺得更广。"其兴也勃焉",往往就是从"降本"讲成"扩张"的这一步开始的。
道理没错,但道理和账本是两件事。GPT-5.6 Sol在编程基准上少用54%的输出token,这是读者能感知到的真实效率提升;Jalapeño的效率数字,读者感知不到,只能信OpenAI一家之言。这中间的差距,决定了这份成绩单到底是技术突破,还是给下一轮融资叙事铺台阶。
Jalapeño的下一代芯片和量产规模,才是真正检验这套说法的时间点。如果到那时候,数据还只有OpenAI一家公布,这场戏就还没走到能被验证的环节。
