一个连模型卡都没有的AI,却在OpenRouter上被免费开放调用,上下文窗口能塞下一整本长篇小说。这就是Ox Alpha——8月20日空降的“隐身模型”,官方介绍只写了一句话:面向编程、长程agent任务和生产负载的推理模型。没有团队署名,没有论文,连开发方是谁都语焉不详。Stripe CEO Patrick Collison在X上说它“very impressive”,而他的公司正在收购OpenRouter。一句夸奖,把整个AI圈的好奇心点着了。

参数比故事更诚实

身份可以藏,参数藏不住。Ox Alpha的上下文窗口达到1,048,576 tokens,最大输出131,072 tokens,支持文本、图片、视频输入,只能输出文本。推理能力默认强制开启,分低、高、max三档,默认给到最高档。预览期输入输出全部免费。

这套组合看起来更像一次“亮肌肉”的技术展示,而不是急着变现的商业发布——毕竟免费本身就是最贵的营销。

Ox Alpha 关键参数 1,048,576 上下文窗口(tokens) 131,072 最大输出(tokens) $0 预览期定价

破案靠的不是自白,是报错文案

没人承认,不代表查不出来。社区玩起了黑盒侦探:比对Ox Alpha的tokenizer行为、无效参数时的报错文案、强制推理三档这套设置,发现和Z.ai的GLM-5.3官方文档几乎逐条对应——包括同样约百万token的评测配置、同样超大的输出上限。更有意思的是,部分测试者反馈模型偶尔用中文报错,甚至自称是Z.ai GLM。

竞争假说也没消停。此前有分析猜测这是微软MAI家族的未发布版本,理由同样是tokenizer特征比对,但证据链和Z.ai假说互相打架,谁也没能一锤定音。Hugging Face上也只挂着一个缺乏元数据、无法验证的同名仓库,官方发布记录是空的。

两种嫌疑,谁的证据更硬 Z.ai / GLM 假说 · 推理三档设置一致 · 百万token评测配置吻合 · 中文报错文案 · 模型自称GLM 社区支持度较高 微软 MAI 假说 · tokenizer特征部分相似 · 无官方确认 · 与GLM假说互相矛盾 证据较薄

身份仍未坐实,但排除法已经让选项收窄了不少。这更接近一次技术验DNA,而不是空对空的八卦。


官网晒的80%,经不起第三方复盘

真正该被打问号的,不是“它是谁”,而是“它到底多强”。oxalpha.com自己发的10任务小样本对比里,Ox Alpha平均分80%,领先GLM-5.3、Grok 4.6等一众对手——但对照组跑了4次取最好成绩,Ox Alpha只跑了1次。这种比法,赢了也不算赢。

第三方跑分给出的是另一幅面孔。LiveCodeBench单次尝试测评里,它拿到28.0% pass@1,成绩平平。DeepSWEagentic编程测试跑了近21小时,综合得分58.4%,解出113题里的66题,数字亮眼一些,但测试者同时记录了工具调用格式失败、推理token计数不可靠等问题。

三份成绩单叠在一起,说明这个模型很可能“更擅长长程agent任务,弱于一次性代码生成”——但由于三份测试的脚手架和条件完全不同,这个结论也只能停在“更像”,不能拍死。

三份成绩单,三种口径 官网自测(单次vs4次) 80% DeepSWE agentic(第三方) 58.4% LiveCodeBench pass@1 28.0%
  • 风险.OpenRouter官方声明匿名提供方会保留prompt和completion记录,承诺不用于训练,但这份承诺没有第三方审计。往里塞专有代码、机密文档的开发者,等于把这份信任交给了一个连名字都不敢公开的运营方。

谁在乎它是谁

回到最初那条推文。Collison说它“very impressive”的时候,他的公司正在收购OpenRouter这个平台本身。这条评论到底是纯粹的技术欣赏,还是带着一点“我们要买的东西正好很热”的顺水推舟,原文没给答案,读者自己判断就好。

名可隐,指纹难藏

如果Ox Alpha最终坐实是Z.ai未发布的模型,这件事的重量就不只是“猜对了一个身份”。“天下熙熙,皆为利来”——Z.ai若真在用匿名马甲绕开“中国AI”这个标签做全球分发,那说明贴标签这件事,已经变成了产品定价和市场准入的一部分,而不只是舆论情绪。这也不是新鲜套路,Grok、GLM都用过类似的stealth发布试水,借助OpenRouter这类不开发模型、只做托管计费的中立平台,先拿免费流量换真实反馈,再决定要不要摘下面具。

对普通开发者,眼下能做的判断很简单:好奇心可以放,风险意识不能放。拿它跑跑非敏感的demo任务没问题,真要塞进生产环境处理专有代码,先想清楚数据流向问题——身份没揭晓之前,信任本身就是一笔未结清的账。