AI推理单价断崖式下跌,底层的算力租金却纹丝不动甚至逆势走高。截至2026年8月,汇集Ornn、Silicon Data与彭博的行业数据显示,模型推理Token单价跌入谷底,而英伟达H100云端租金却依然坚挺。风投机构a16z迅速下场定调,称这是AI基础设施领域教科书般的杰文斯悖论(Jevons Paradox):单价越便宜,催生出的自动化Agent需求越大,最终吃掉更多芯片。黄仁勋似乎又一次赢麻了。

但把降价促销直接等同于硬件采购的永动机,不仅忽略了统计口径的偏差,也美化了真实世界的商业回报。

被包装的做市商曲线与统计偏差

那张在投资人朋友圈疯传的对比图表,核心出处并非a16z的原创发现,而是做市商Citadel Securities在2026年8月18日发布的宏观研报《Elastic Expectations》。撰写者Frank Flight在报告中给出的定性非常克制,明确标注该证据属于初步且试探性的观察。在此之前,a16z早在2025年11月12日发表过题为《Jevons or Bust》的备忘录,并在2026年6月24日领投了算力基准平台Ornn的3300万美元种子轮,经过几道资本链条的互相转引,一份试探性的做市研报被直接包装成了芯片霸权的定论。

底层指数的统计口径本身就暗藏玄机。

Ornn算力价格指数自2026年7月24日起采用按小时滚动的交易量加权缩尾均值,统计范围极其狭窄,仅覆盖即时租金(on-demand),完全剔除了大客户动辄锁定数年的长期预留合约。散户与初创团队在现货市场的短期扫货,根本无法代表整体算力资产的供需全貌。

与之相对的Silicon Data代币支出指数,记录的是用量加权价格。这个指数的下坠,不仅来自厂商的主动降价,更源于大量工作负载向极廉价小模型的自然转移。

算力指标口径与真实供需的断层 Ornn 算力价格指数 (OCPI) • 统计样本仅限即时现货短租 • 剔除大企业长期预留合约 • 放大短线波动,遮蔽真实池容量 结论:短租坚挺不等于全面缺卡 Silicon Data 支出指数 (SDLLMTK) • 用量加权价格急剧下跌 • 混杂大量廉价小模型的结构替代 • 单价下跌不等于有用功爆发 结论:价格下跌含客户降级水分

把这种包含小模型迁移的价格跌幅,与剔除长约的现货短租坚挺拼在一起,得出的杰文斯叙事更像是一场数据剪裁。

膨胀的调用量与缩水的现金流

不可否认,机器自主调用的需求确实在爆炸。开源模型分发网关OpenRouter的周消耗Token量,从2025年1月13日当周的0.5万亿,一路飙升到2026年9月14日当周的128.4万亿,规模暴增超250倍。其中,Agent调用在2026年2月6日反超人类操作,到了9月最后一周,Agent消耗的Token已经达到人类调用的约7倍。

但庞大的数字底层是一场空转。

OpenRouter披露的结构数据显示,2026年9月Agent调用的Token中,近90%为缓存提示词(cached prompt),系统真正在做推理、生成内容的输出Token仅占约1%。

借助上下文缓存机制,缓存命中时的百万Token成本会从2.08美元骤降到0.51美元。Agent在不断循环读取历史记忆、系统提示词和状态日志,硬件并没有满负荷进行复杂的浮点生成运算,只是在内存中搬运重复数据。

繁荣的表面是万亿级Token在代码循环中空转,背后是单Token变现能力的断崖式下坠。

这种虚胖直接反映在财务账面上。OpenRouter曾做过降价测试,旗下Terra与Luna模型降价60%到90%后,调用量确实猛增了5.6倍至13.8倍。但细查去向,大约75%的份额增长只是把其他厂商的用户薅了过来,初次留存观测期仅维持了6天。

Sacra预估OpenRouter在2026年7月的年化收入达到1.4亿美元,但综合算下来,单Token货币化率下降约60%。换句话说,开发者跑的Token越来越不值钱,调用量增长根本填不平单位收益的缩水。

Agent 爆发背后的消耗与收益失衡 250x+ Token 周消耗量增速 从 0.5万亿 飙升至 128.4万亿 近 90% 低成本缓存提示词 实际生成输出 Token 仅占 1% -60% 单 Token 货币化率 降价换量但并未带来等额回报
  • 风险.当90%的调用都被缓存抵消且变现率暴跌时,终端软件企业的真实投资回报率(ROI)很难成立,一旦外部融资收紧,虚假繁荣的调用量会被瞬间挤出水分。

吞吐量反噬与推理战场的变数

退一步讲,即便Token总需求真能保持指数级攀升,这些需求最终能折算成多少张物理显卡采购,依然是个大问号。

问题出在单芯片吞吐效率的飞跃上。英伟达官方宣称,GB300 NVL72在特定低延迟工作负载下,每Token的推理成本相比Hopper架构降低最多达35倍。如果一套新系统能把产出效率提高30多倍,应用端的Token总量增速就必须跑赢这个倍率,企业才需要采购更多物理机柜。硬件吞吐的大幅提升,在短期内是在消解而不是增加服务器采购量。

更关键的转折发生在推理架构的壁垒松动。在模型训练阶段,英伟达凭借CUDA生态筑起了难以撼动的护城河;但在推理阶段,云厂商和竞争对手的专用架构正在迅速反扑。

硬件平台评测模型与精度实测持有成本 (每百万Token)相对性能与成本优势
Google Ironwood TPUQwen3.5 397B FP80.181 美元持有成本比 B200 低 18%,比 B300 低 34%
NVIDIA B200 HGXQwen3.5 397B FP80.222 美元性能主流,但整体综合持有成本偏高
NVIDIA B300 NVLQwen3.5 397B FP80.276 美元定价处于高位,面临自研芯片挤压
AMD MI355XLlama 3.1 405B FP4—官方标称每美元产出较 B200 高 40%

行业分析机构SemiAnalysis旗下的InferenceX在2026年9月7日给出了具体测算,运行Qwen3.5 397B FP8时,Google Ironwood TPU的模型持有成本仅为0.181美元/百万Token,明显低于英伟达B200的0.222美元以及B300的0.276美元。同时,AMD公布的基准测试也显示,MI355X在运行Llama 3.1 405B FP4时,每美元Token产出较B200高出多达40%。

  • 结论.推理市场不是训练市场的简单复制。企业不再迷信单卡峰值算力,而是锱铢必较单位Token持有成本,英伟达的高溢价定价权正在被Google和AMD的定制方案稀释。

英国经济学家威廉·斯坦利·杰文斯当年观察蒸汽机时提出,煤炭利用效率的提升引发了工业规模扩张,最终吃掉了更多煤炭。但这个闭环能转起来的前提,是工厂用煤炭纺出了真正的棉布、运出了真实的货物,有人愿意为此买单。

如今AI供应链的神经已经绷紧到了极点。资本市场对终端商业闭环极其脆弱,OpenAI年化收入传出低于预期的风吹草动,美股半导体链条便集体承压。当Agent的循环调用无法转化为可持续的利润,当单芯片吞吐效率反噬硬件采购规模,杰文斯悖论的飞轮随时可能在某个临界点卡死。