周末刚过去,Ox Alpha的身份就揭晓了:Z.ai(智谱)。这个答案圈内早有猜测,算不上意外。真正值得留意的是另一件事——身份公布当天,OpenRouter上那个专门用来匿名投放Ox Alpha的Stealth服务商页面,在线模型数量已经归零。悬念揭晓,免费通道同一天关掉,这场戏收得干净利落。

Z.ai向Bloomberg确认,Ox Alpha是GLM系列的最新迭代,权重将于8月26日晚间开源发布。但官方说法只有一句「新迭代」,具体是哪个版本,规格和实测之间有没有出入,公司没细说。这些细节,恰恰是判断这次「揭盘」含金量的关键。

身份是怎么被扒出来的

在Z.ai官宣之前,社区已经用技术痕迹把答案锁定得七七八八。核心证据是tokenizer指纹比对:Ox Alpha的分词器指纹与GLM-5世代的匹配度达到44/44,明显高于GLM-4.x的42/44。加上API报错信息和推理控制行为的相似性,在Bloomberg报道之前,圈内已经把嫌疑锁定在Z.ai身上。这次身份揭晓,与其说是意外反转,不如说是印证了一次扎实的社区侦查。

对应的产品线叫GLM-5.3-Flash:MoE架构,总参数320B,激活参数18B,支持文本、图像、视频输入,上下文窗口约105万token,最大输出约13万token。

规格对不上号

这里出现一个不大不小的疑点。Z.ai官方文档披露的标准GLM-5规格是:20万token上下文,12.8万输出上限,纯文本输入。Ox Alpha实测的规格几乎是标准版的五倍上下文,还多了图像和视频输入。

规格对不上号 官方GLM-5文档 Ox Alpha实测 上下文窗口 20万 token 上下文窗口 约105万 token 最大输出 12.8万 token 最大输出 约13万 token 输入类型 纯文本 输入类型 文本+图像+视频 同一份文档,两套数字——Ox Alpha更像定制变体,而非标准端点

两组数字对不上,说明Ox Alpha大概率不是标准GLM-5端点,而是针对长上下文、多模态场景定制的服务变体。即将开源的权重,未必和预览期用到的版本完全一致——接入前该心里有数。

「吊打Claude」的说法,被更大样本证伪了

Ox Alpha走红的最大推力,是社交媒体上流传的一个说法:在10个任务的测试里,它以80%的胜率击败了Claude和GPT。这个数字后来被更大规模的独立测试打回了原形。

跑分打假:宣传语 vs 独立测试 社交传言(10任务) 80% DeepSWE(113任务) 58.4% LiveCodeBench pass@1 28.0% Terminal-Bench严格通过 25% 对比:Opus5+agent 42.7% 10个任务的胜率撑不起"吊打",113个任务的通过率才是底牌

DeepSWE用113个真实软件工程任务重新测了一遍,Ox Alpha通过率58.4%,95%置信区间49.2%到67.1%——离「吊打」两个字很远。LiveCodeBench的纯代码生成测试(不带agent、不带工具)里,Ox Alpha的pass@1只有28.0%,简单题51.2%,难题跌到13.8%。Terminal-Bench 3.0的结果更直接:Ox Alpha严格通过率25%,而Claude Opus 5配合agent框架能做到42.7%,GPT-5.6 Sol配Codex是34.6%。

10个任务的胜率是烟花,113个任务的通过率才是底牌。

三组独立测试拼在一起,能看出Ox Alpha真实的定位:一个agent化编程场景下表现不错、但纯代码生成能力并不顶尖的模型。它在DeepSWE这类agent任务里的相对优势,更可能来自工具调用和框架加成,而不是底层代码生成能力的突破。

  • 风险.Reddit上的早期反馈也印证了这一点——首版代码质量和视觉审查被称赞,但长任务、多文件场景推理拥堵、429限流频发,服务商还保留了prompt和输出内容,企业用户接入前得先算清隐私账。

预览免费,正式收费

免费预览结束,定价已经摆出来:

版本输入(每百万token)输出(每百万token)
Ox Alpha 预览期免费免费
Ox Alpha/GLM-5.3-Flash 官方定价$0.15$0.50
Ox Alpha OpenRouter早期报价$0.075$0.25
常规GLM-5.3(OpenRouter)$1.40$4.40

预览期的免费换来的是社区自发跑分和话题度。等热度冲顶,Z.ai再揭盘、开源,给出比自家常规版便宜近十倍的定价——这不是技术炫技,是一次算好时间点的获客动作。Grok、Gemini都用过同样的路数:匿名投放、社区测评、择机收割,Z.ai只是把流程走得更利落。

  • 结论.身份已经不是悬念,真正该盯的是权重开源后,这个定价能不能在生产环境里稳定撑住。