周末刚过去,Ox Alpha的身份就揭晓了:Z.ai(智谱)。这个答案圈内早有猜测,算不上意外。真正值得留意的是另一件事——身份公布当天,OpenRouter上那个专门用来匿名投放Ox Alpha的Stealth服务商页面,在线模型数量已经归零。悬念揭晓,免费通道同一天关掉,这场戏收得干净利落。
Z.ai向Bloomberg确认,Ox Alpha是GLM系列的最新迭代,权重将于8月26日晚间开源发布。但官方说法只有一句「新迭代」,具体是哪个版本,规格和实测之间有没有出入,公司没细说。这些细节,恰恰是判断这次「揭盘」含金量的关键。
身份是怎么被扒出来的
在Z.ai官宣之前,社区已经用技术痕迹把答案锁定得七七八八。核心证据是tokenizer指纹比对:Ox Alpha的分词器指纹与GLM-5世代的匹配度达到44/44,明显高于GLM-4.x的42/44。加上API报错信息和推理控制行为的相似性,在Bloomberg报道之前,圈内已经把嫌疑锁定在Z.ai身上。这次身份揭晓,与其说是意外反转,不如说是印证了一次扎实的社区侦查。
对应的产品线叫GLM-5.3-Flash:MoE架构,总参数320B,激活参数18B,支持文本、图像、视频输入,上下文窗口约105万token,最大输出约13万token。
规格对不上号
这里出现一个不大不小的疑点。Z.ai官方文档披露的标准GLM-5规格是:20万token上下文,12.8万输出上限,纯文本输入。Ox Alpha实测的规格几乎是标准版的五倍上下文,还多了图像和视频输入。
两组数字对不上,说明Ox Alpha大概率不是标准GLM-5端点,而是针对长上下文、多模态场景定制的服务变体。即将开源的权重,未必和预览期用到的版本完全一致——接入前该心里有数。
「吊打Claude」的说法,被更大样本证伪了
Ox Alpha走红的最大推力,是社交媒体上流传的一个说法:在10个任务的测试里,它以80%的胜率击败了Claude和GPT。这个数字后来被更大规模的独立测试打回了原形。
DeepSWE用113个真实软件工程任务重新测了一遍,Ox Alpha通过率58.4%,95%置信区间49.2%到67.1%——离「吊打」两个字很远。LiveCodeBench的纯代码生成测试(不带agent、不带工具)里,Ox Alpha的pass@1只有28.0%,简单题51.2%,难题跌到13.8%。Terminal-Bench 3.0的结果更直接:Ox Alpha严格通过率25%,而Claude Opus 5配合agent框架能做到42.7%,GPT-5.6 Sol配Codex是34.6%。
10个任务的胜率是烟花,113个任务的通过率才是底牌。
三组独立测试拼在一起,能看出Ox Alpha真实的定位:一个agent化编程场景下表现不错、但纯代码生成能力并不顶尖的模型。它在DeepSWE这类agent任务里的相对优势,更可能来自工具调用和框架加成,而不是底层代码生成能力的突破。
- 风险.Reddit上的早期反馈也印证了这一点——首版代码质量和视觉审查被称赞,但长任务、多文件场景推理拥堵、429限流频发,服务商还保留了prompt和输出内容,企业用户接入前得先算清隐私账。
预览免费,正式收费
免费预览结束,定价已经摆出来:
| 版本 | 输入(每百万token) | 输出(每百万token) |
|---|---|---|
| Ox Alpha 预览期 | 免费 | 免费 |
| Ox Alpha/GLM-5.3-Flash 官方定价 | $0.15 | $0.50 |
| Ox Alpha OpenRouter早期报价 | $0.075 | $0.25 |
| 常规GLM-5.3(OpenRouter) | $1.40 | $4.40 |
预览期的免费换来的是社区自发跑分和话题度。等热度冲顶,Z.ai再揭盘、开源,给出比自家常规版便宜近十倍的定价——这不是技术炫技,是一次算好时间点的获客动作。Grok、Gemini都用过同样的路数:匿名投放、社区测评、择机收割,Z.ai只是把流程走得更利落。
- 结论.身份已经不是悬念,真正该盯的是权重开源后,这个定价能不能在生产环境里稳定撑住。
