智谱在2026年9月17日披露,其总参数达320B的新一代混合注意力模型GLM-5.3-Flash,已全量运行在超过10万张国产AI芯片构建的超大规模集群上。整个生产级推理栈的底层适配与调优,由内部模型GLM-5.3驱动的Infra Agent在两周内完成,端到端吞吐相比基线提升了约3倍。
在此之前,该模型以Ox-Alpha的匿名代号在OpenRouter与OpenCode低调测试,6天录得超62万亿Token的处理量。当一家模型厂商宣称自己的系统正在由AI自主编写基础设施代码,甚至走向递归自我改进时,行业往往容易被科幻色彩的叙事带偏。褪去自进化光环后,这更像是一场在显存带宽受限与底层算子不完备的现实重压下,凭借算法大修、缓存复用与工程脚手架打赢的系统级防御战。
62万亿Token账面繁荣,与未被拆解的真实计算负载
在公测阶段,Ox-Alpha凭借高并发与极低延迟迅速登顶各大调用榜单,OpenCode遥测数据显示其在测试期覆盖了约50.5万独立用户,完成了1320万次会话。但粗看惊人的62万亿Token并非单一审计报表,而是OpenRouter公布的超20万亿与OpenCode遥测记录的约44万亿简单相加。两家平台的请求路由存在重复计算可能,更关键的结构性变量藏在流量形态里:在OpenCode记录的负载中,约94%的输入流量属于前缀缓存命中。

超高缓存命中率说明绝大部分计算并非从零跑满100万Token的上下文计算,而是海量代码补全场景下对静态上下文的高频复用。模型的商业化定价也印证了这一倾斜:未缓存输入为每百万Token 0.15美元,缓存输入直接降至0.03美元,输出则为0.50美元,此前的半价首发优惠已于2026年9月9日截止。
这种差异在模型能力测试中尤为分裂。第三方基准显示,Ox-Alpha在具备完整Docker运行环境的DeepSWE评测中拿下了64.6%的Pass@1表现,在113个真实软件工程任务中通过73项;但在脱离Agent工程脚手架的纯逻辑代码基准LiveCodeBench v6上,其得分跌落至28.0%。它清楚指明了一点:GLM-5.3-Flash不是全知全能的超级智能,它是一套深度适配工程循环的特定工具。
显存洼地的解题法:架构大修换取硬件生存空间
在超过10万张国产算力卡上支撑百万级长文本,最严苛的物理约束是显存容量与互联带宽。GLM-5.3-Flash采用总参数320B、激活参数约18B的MoE架构,原生FP8权重占据了约306 GiB显存。如果沿用传统全局注意力机制,1048576 Token的上下文窗口所产生的KV Cache将直接击穿任何现有加速卡集群的内存墙。

工程团队的化解方式是从模型结构动刀。该架构由34层KDA线性注意力与11层稀疏MLA混合组成,相比上一代GLM-5.3,注意力计算量减少了约3倍,KV Cache占用更是骤降4.4倍。
在服务架构层面,智谱基于开源推理引擎SGLang进行了深度定制,引入EPD编码、预填充与解码解耦架构,结合节点内张量并行、ReplaySSM机制、W8A8权重量化,以及针对缓存的INT8、FP8与BF16混合精度量化策略。
决定国产芯片推理可用性的核心不是硬拼FLOPS,而是用算法架构极力避开显存带宽瓶颈。
硬件基准测试反映出大模型推理在面对极高并发时的普遍物理限制。在4张NVIDIA B200硬件环境中,使用标准SGLang测试GLM-5.3-Flash,在并发达到256时总吞吐虽可达2590.8 tok/s,但首字延迟已剧烈恶化至31.17秒。智谱正是通过计算换带宽、通信换显存的精细编排,才让国产卡集群在端到端成本和单Token产出上逼近了主流显卡的水准。
调试脚手架的胜利,而非全自主进化的神话
在智谱的叙事中,两周内吞吐翻三倍归功于Infra Agent。但把视线放进真实工程现场就会发现,AI并没有展现出脱离人类控制的自发创造力,它所依赖的是工程师预先搭好的细粒度可归因反馈闭环。

传统推理优化中,工程师面对的是端到端指标,诸如延迟上升或者显存溢出。模型直接面对这些宏观数字时往往束手无策,根本无法定位是算子实现、并行策略还是通信等待的问题。智谱所做的工作,是把复杂的系统指标拆解为微基准评测、运行期跟踪事件和内核级数值校验。
在Flash Linear Attention开源仓库合并的PR #1180中,记录了一个典型案例:在KDA算子的上下文并行路径中,原本计算默认采用TF32精度,导致误差在长上下文切片传递中迅速累积。Infra Agent之所以能定位该缺陷并将计算改为tf32x3以平衡精度与速度,是因为测试框架直接指明了并行切片与未切片输出之间的误差偏离,而非给出一个模糊的系统报错。
- 结论.大模型在底层基础设施调优上的生产力释放,不取决于提示词有多精巧,而取决于研发团队能否把黑盒系统的运行状态切碎成机器可验证的微型单元。
这场突围背后依然立着一道不可忽视的技术高墙。在公开材料中,智谱并未披露这10万张加速卡的具体芯片型号与绝对吞吐表现。审视整个开源生态,目前公开发布的国产芯片配方(例如vLLM-Ascend)仅在8张昇腾950PR(128GB)硬件上验证了131K上下文限制下的TP8运行,社区至今拿不出支持全量100万上下文的开源方案。
这意味着,大模型在国产芯片上的极致压榨,目前仍然高度依赖头部厂商私有的工程定制与未公开的底层调试补丁。当算法架构创新暂时跑赢了硬件制程封锁,如何把闭门自研的工具链转化为全行业可复用的通用生态,才是这10万张芯片集群在账面数字之外更迫切的课题。
