2018年ISCA大会上,Hennessy和Patterson在图灵演讲里留下一句预言:接下来十年,计算机架构会迎来一场寒武纪大爆发。八年过去,这句话几乎字字兑现——GPU、TPU、LPU、NPU、DPU、晶圆级引擎、可重构数据流、类脑芯片、光子计算、模拟计算,名录长得能编成词典。但把这份名单摊开清点会发现,真正拿到规模化订单、跑在生产环境里的只剩五个:NVIDIA的GPUGoogle的TPUAWS的TrainiumCerebras的晶圆级引擎,以及刚被NVIDIA收编技术团队的Groq LPU。热闹的名录和冷清的实际战场之间,隔着一层内存墙——这比谁家GW数字更大重要得多。

内存墙才是真正的选拔赛

一块芯片能不能活下来,本质是看它怎么应对三种完全不同的负载。训练和推理里的“预填充”阶段,是把成千上万个token同时怼进同一组权重矩阵,矩阵乘矩阵,计算强度高,考验的是算力堆得够不够猛。但推理里的“解码”阶段,模型一次只吐一个词,矩阵退化成向量,每生成一个token都要把全部权重和KV缓存搬一遍——算力用不满,带宽先跑断。这就是原文说的内存墙:算力增速远超带宽增速。

  • 结论.芯片架构的路数分野,本质上是在回答同一个问题——数据搬不动的时候,谁先撑住。
同一张芯片,两种算力游戏 训练 / 预填充 矩阵 × 矩阵 (GEMM) 千万token同时喂权重 算力强度高 算力瓶颈 吃满Tensor Core/脉动阵列 解码 (自回归) 矩阵 × 向量 (GEMV) 一次一个token 需读全部权重+KV缓存 带宽瓶颈 靠连续批处理/投机解码补救

GW数字和百万芯片,哪些已经交卷

2026年最扎眼的一批新闻,都是这个句式:某公司拿下多少GW算力,某公司锁定百万芯片。但把这些公告拆开看时间表,会发现绝大多数是多年期、带上限的承诺,不是已经上线的产能。

OpenAI与AMD的6GW协议是多代际安排,首批1GW MI450要到2026下半年才开始部署,OpenAI还拿到最多1.6亿股AMD股票认购权,附业绩里程碑条件——这更像一份深度绑定的对赌协议,而不是一张已经交货的订单。Meta与AMD同样谈的是6GW上限,首批部署也定在2026下半年。Anthropic与Google宣布的“百万TPU”是产能上限,预计在2026年内带来超过1GW上线算力;双方随后又和Broadcom签了新协议,锁定数吉瓦下一代TPU容量,但要等到2027年才上线。相对更能对上账的是AWS:Project Rainier目前已实际部署近50万颗Trainium2,官方目标是到2026年底让Claude跑在超过100万颗芯片上——这是尚未完成的目标,不是现状。

承诺的GW与上线的GW,不是一回事 OpenAI × AMD 承诺 6GW 首批1GW · 2026下半年部署 附股权认购+业绩里程碑 Meta × AMD 承诺 上限6GW 首批部署 · 2026下半年 尚未有实际交付数据 Anthropic × Google 上限百万颗TPU 2026年内上线超1GW 下一代产能要等2027年 Anthropic × AWS 已部署约50万颗 目标2026底破100万颗 四家里唯一有实测进度可查

NVIDIA“收购”Groq?其实是一张授权协议

流传最广的一句表述是“NVIDIA以200亿美元收购Groq”。官方口径不是这样:这笔交易的结构是非独家技术许可协议,加上核心团队加盟——包括Groq创始人Jonathan Ross、总裁Sunny Madra在内的关键人员进入NVIDIA,但Groq公司本身没有被卖掉。证据也很直接:Groq交易之后仍以GroqCloud的名义独立运营,并在2026年8月又完成了一轮3.5亿美元的A轮融资。一家真被收购的公司,不会在几个月后自己去市场上再融一轮钱。

这个区分不是抠字眼。Groq押注的是编译器静态调度带来的确定性低延迟——这条技术路线现在进了NVIDIA的产品序列,但Groq作为独立公司还要继续在NVIDIA、AMD和云厂商自研芯片的夹击下找自己的商业化空间。类似的模糊地带还有OpenAI与Cerebras的合作:官宣的750MW低延迟推理算力要分批部署到2028年才能全部上线,Cerebras随后披露这笔多年期协议总价值超过200亿美元——数字很大,兑现周期同样很长。

29倍效率的老账,不该再当成今天的现实

原文引用的“TPU比GPU快29倍、能效高80倍”,是图灵演讲里的经典例证,但这组数字来自TPU v1一颗8位整数矩阵乘法单元、28MiB片上缓冲区、约92 TOPS峰值吞吐的芯片,测试对手是2015年的NVIDIA K80 GPU和Intel Haswell CPU,跑的还是谷歌自家的特定生产推理负载。真实区间是15到30倍速度提升、30到80倍能效提升,不是放之四海皆准的通用比值,更不能拿来直接套用今天的TPU和NVIDIA最新一代GPU的对比。十年后的今天,Cerebras的晶圆级引擎堆到约90万个核心、44GB片上SRAM,AWS的Trainium2单机柜能拼到64颗芯片、峰值83.2 FP8 petaflops——专用架构确实还在往前走,但优势幅度早已不是当年那个数字能代表的。

内存墙不认GW,只认带宽账本。

对Anthropic这样同时压注TPU、Trainium、NVIDIA GPU三条线的公司来说,真正的考验不是谁的GW数字更亮眼,而是软件栈能不能在三种截然不同的架构上跑出同一套模型而不掉性能。对普通读者和投资者而言,看到“GW”“百万芯片”这类数字时,先问一句:这是已经点亮的算力,还是一张分期付款的账单。

  • 风险.GW级承诺普遍带“上限”和“分阶段”条件,首批部署最快也要2026下半年,把公告数字当现状极易高估行业实际算力格局。