OpenAI本周二公布了自研推理芯片Jalapeño的跑分成绩,对阵目标是英伟达GB200和GB300。测试显示,Jalapeño同时拿下了更低延迟和更高能效,这两项指标在推理芯片里通常互相牵制。OpenAI硬件副总裁Richard Ho把这形容为"两头都占"。
这不只是技术炫技。它说明OpenAI正试图用定制芯片缓解推理成本压力,减少对英伟达的依赖。但这份成绩单是OpenAI自己选的基准、自己挑的对比对象、自己发的数据,离"全面超越英伟达"还有很长距离。
跑分怎么赢的:能效、延迟同时压过GB300
Jalapeño是OpenAI与博通联合开发的专用芯片(ASIC),今年6月首次公开,只做一件事——AI推理。模型训练完成后,真正被调用去回答问题、驱动智能体的那一步,就是它的战场。
这次测试用的是SemiAnalysis旗下的InferenceX平台,跑了三个模型:GPT-OSS 120B、DeepSeek R1、Kimi K2.5 1T。
| 对比项 | 英伟达GB300(基准) | Jalapeño |
|---|---|---|
| 每瓦算力(能效) | 1.0x | 1.5~1.9倍 |
| 端到端延迟 | 1.0x | 降低1.7~3.6倍 |
| 测试模型 | — | GPT-OSS 120B、DeepSeek R1、Kimi K2.5 1T |
| 数据来源 | — | OpenAI自选InferenceX测试,未经第三方复核 |
OpenAI没公开测试用的并发量、功耗测量口径和延迟定义,只给了倍数结果。这些细节决定了跑分能不能被复现,目前外界还看不到。
延迟和吞吐量通常是一对矛盾:想让单次请求更快返回,往往要牺牲同一时间能处理的请求总量。Jalapeño的卖点,是号称同时改善了这两项——但这套说法目前只有OpenAI一家背书。
真正的门槛:价格、总拥有成本和供货规模还没答案
跑分好看,但决定芯片能不能被真正采购的,从来不是跑分表。是三件事:价格、总拥有成本、供货规模。OpenAI这次都没公布。
能效提升不等于账单变薄。推理成本还要看芯片良率、制造成本,以及英伟达用CUDA攒了十几年的软件工具链能不能顺利迁移过去。这是英伟达最深的护城河,一份跑分报告绕不过去。
部署节奏也说明问题。Jalapeño计划2026年底"小批量"上线,2027年才逐步放量。眼下的领先更像实验室成绩,离扛起OpenAI日常推理流量还有距离。
谁该盯着这件事:云服务商按兵不动,开发者暂时无感
对AI云服务商和企业基础设施采购者,这份成绩单值得记下来,但不该现在就调整采购计划。真正该等的是2026年底小批量部署之后的实际数据——单位推理成本、良率、供货能力,这些比跑分更能决定要不要下单。
对开发者和关注响应速度的专业用户,短期内感受不到变化。现有产品跑在英伟达GPU集群上,不会因为一份跑分报告换基础设施或改工具链。真正能感受到差异的时间点,是Jalapeño接入实际产品之后——至少要等到2026年底那批小批量部署跑起来。
