打开Artificial Analysis给GLM-5.3建的评测页面,你会发现一件怪事:页面框架齐全,标题、图表位置都摆好了,但填进去的全是“什么是Intelligence Index”“什么是AA-Omniscience”这类方法论说明文字——没有一个真实分数。可社交媒体上早就传开了,说GLM-5.3拿到了60分智能指数,吊打上一代。一个连数据都没填的页面,怎么就先长出了一个具体分数?
GLM-5.3到底是什么
先把硬参数说清楚,这比“跑了多少分”更值得记住,因为它决定了你到底在比较什么。
- 官方型号ID是glm-5.3,「Max」不是独立发布的新模型,只是reasoning_effort参数里跟high、low并列的一档设置
- API定价.输入1.40美元/百万token,缓存输入0.26美元,输出4.40美元——和GLM-5.2、5.1完全一致,没涨价也没降价
- 上下文窗口100万token,最大输出12.8万token
很多人以为GLM-5.3 Max是一个更大的模型,其实它只是同一个模型调高了“想得更久”的开关。
厂商自己晒的分数,确实好看
Z.ai公布的对比数据里,GLM-5.3相对5.2的提升集中在编程agent和网络安全类基准:Terminal-Bench 3.0从4.6分冲到28.3,DeepSWE v1.1从46.2到66.9,CyberGym从77.2%到84.5%,ExploitBench从24.4%到54.4%。
这些跳跃幅度不小,但全部来自厂商自测,尚未见到独立复现。这类基准通常依赖特定的评测框架,不同团队跑出的数字经常对不上号。
「60分」是哪来的
截至目前,Artificial Analysis官网还没有给GLM-5.3发布正式的Intelligence Index分数——这也是那个页面为什么是空壳的原因。能查到的唯一确切参照,是它的上一代:GLM-5.2 (max)在这项指数上得51分,每个任务的加权成本约0.69美元。
放在同期其他模型旁边看会更清楚:Claude Opus 5 max是61分(每任务2.34美元),GPT-5.6 Sol max是59分(1.86美元),已经下线的Kimi K2.5只有36分但每任务成本仅0.10美元。GLM-5.2当时的位置是中等分数、极具性价比。
「60分」如果真的存在,大概率是社区根据厂商自测数据和历史涨幅做的推测,或者是提前拿到内测access的用户口口相传——但它不是Artificial Analysis出具的结果。权威评测还没落地,先把传闻当结论,是这个行业反复发作的老毛病。
能力涨了,不代表更可信了
编程agent能力和事实可靠性,是两件完全不同的事。GLM-5.2在AA-Omniscience上的基线不算好看:准确率25.1%,幻觉率28.1%,可靠性指数只有4——意味着它每答对一次,就有超过一次答错还一本正经。
GLM-5.3有没有改善这个数字?目前没有任何独立测试给出答案。Z.ai秀出的Terminal-Bench、CyberGym涨幅,回答的是“模型能不能完成更长的agent任务”,不是“模型说的话有多少是真的”。
更值得注意的是,Z.ai自己在博客里承认,GLM-5系列在高并发、长上下文的agent工作负载下,存在乱码、重复输出、生成罕见字符等服务端异常,并把原因归到服务端bug而非模型本身。
- 风险.编程/安全类跑分飙升的同时,幻觉率和服务稳定性这两项更贴近生产环境体验的指标,目前都缺乏独立数据支撑。
耳听为虚,眼见为实——GLM-5.3的“眼见”,还没人真见过。
接下来该盯住什么
对准备把GLM-5.3放进生产环境的团队,有几件事比传闻里的分数更值得等:Artificial Analysis有没有正式给出Intelligence Index和AA-Omniscience成绩;有没有独立开发者复现Terminal-Bench、CyberGym的涨幅;Z.ai已经承认的服务端异常有没有被修好。
厂商想抢发布节奏,评测机构想保证数据准确,这本来就是一场拉锯。只是这一次,拉锯的中间地带先被一个空页面和一个传闻数字占了位置。
