Hot Chips 2026大会上,OpenAI第一次拿出了自研推理芯片Jalapeño的完整跑分。在SemiAnalysis的InferenceX基准测试里,这颗芯片在每用户token数和每千瓦吞吐量上都超过了目前最先进的英伟达Blackwell推理系统。OpenAI硬件负责人Richard Ho在电话会上说,这是"相对现有最先进水平的非常显著的性能提升"。
这句话本身没错,但它省略了一堆限定条件——测试用的是早期硅片,场景是短对话,方法学上也有偏向Jalapeño的地方。跑分好看,不代表这是一场干净的胜利。
数字摆出来:确实不小的优势
具体到测试结果,Jalapeño相比对比系统实现了1.5到1.9倍的每瓦性能,端到端延迟低1.7到3.6倍,交互式工作负载最高能到4.1倍。测试用了三个模型——GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T,对比对象是英伟达GB200或GB300,视模型而定。
芯片本身额定功率700W,但在这批测试工作负载里实测持续功率没超过550W。DeepSeek R1并发数为1时,每用户token速率超过700 tokens/s;GPT-OSS和Kimi K2.5能到约1400 tokens/s/user。Kimi K2.5这一项,Jalapeño每瓦峰值性能约为对比系统的1.5倍,延迟低约3.4倍。
这些数字支撑的架构逻辑不复杂:Jalapeño把模型、芯片、内存放在一个平台里协同设计,目的是压住推理过程里最容易卡壳的两个环节——prefill(计算密集)和跨设备通信。OpenAI在博客里的说法是"最小化数据移动和通信延迟",做法是让KV缓存尽量留在本地,系统再按推理的每个阶段动态分配算力、内存和网络资源。这种打法和Google的TPU、Amazon的Trainium是同一条路——用定制芯片换掉一部分对英伟达GPU的依赖,压低推理成本。
三个"但是",水分藏在方法学里
跑分好看,但仔细看测试条件,会发现这不是一场对等的比较。
第一,这次测试用的是单token预测(STP),没有用多token预测(MTP)或推测解码,也没做prefill-decode分离部署。英伟达很多公开结果用的是MTP,这项技术在部分场景能带来两三倍的交互性提升。STP对MTP的比较,天然更利于Jalapeño;真正干净的架构对比,应该是STP对STP。
第二,被测的是A0阶段早期硅片,项目从启动到现在大约九个月。英伟达那边的软件栈、编译器、通信优化已经打磨多年,双方软件成熟度并不在同一起跑线上——这既可能低估了Blackwell的真实上限,也可能低估了Jalapeño未来的提升空间。SemiAnalysis提到,即将推出的B0版本按工程预测每瓦性能还能再提升约25%,但这只是内部估算,不是公开跑分。
第三,这次测试场景是8K输入、1K输出的相对短上下文,SemiAnalysis直接提醒,这类场景比长上下文、多轮智能体工作负载更容易调优。到发稿时,外界还没看到Jalapeño在AgentX(长上下文、多轮、智能体场景)基准上的结果,SemiAnalysis自己也没有独立跑完整套InferenceX测试,具体数字都是OpenAI提供的。
- 风险.短上下文、单token预测、早期硅片、非独立验证——四个条件叠在一起,这次公布的优势能在多大程度上延续到真实的智能体工作负载,目前还看不清。
跑分是真的,但离"生产级验证"还有一段距离。
原文漏掉的两处细节
一是Celestica。这次合作不只有Broadcom——Broadcom负责芯片实现和网络技术,板卡、机架和系统集成是Celestica在做。原文只提到Broadcom,漏了这层。系统集成商的角色公众关注度低,但真金白银的订单不会少。
二是一处时间线矛盾。TechCrunch原文说Jalapeño"去年10月首次公布",但OpenAI官网关于与Broadcom合作的早期公告发布于2026年6月24日。两个说法对不上,目前没有更权威的信源能统一口径,只能如实标注这个疑点,留给后续报道核实。
接下来盯什么
一个容易被忽略的背景是,这次的对比对象——英伟达Blackwell——本身不是软柚子。此前的InferenceMAX/InferenceX方法学测试发现,Blackwell在GPT-OSS 120B上比AMD的MI355X效率高出约两成。跑赢Blackwell,含金量比跑赢二线对手要高一些。也有分析建议,按技术代际匹配,拿Jalapeño去对标英伟达同样采用HBM4级设计的下一代Rubin,可能比对标Blackwell更合适——毕竟等Jalapeño真正放量,英伟达的产品线也会往前走一代。
部署节奏上,Ho给出的说法是2026年底"非常小的规模"先上,2027年才有更明显的量产。B0硅片能不能兑现那25%的能效提升、AgentX基准何时公开、独立机构会不会完整跑一遍InferenceX——这几件事,比这次发布会上的几个倍数更值得盯着。对云服务商和企业客户来说,现在下"押注非英伟达推理硬件"的结论还早,真正的答卷要等长上下文、智能体场景的独立跑分出来。
