一个27B参数的开源模型,跑分和一个体量可能是它几十倍的对手打平——这是Simon Willison在8月17日的链接博客里抛出的数字:Qwen 3.8 27B在Artificial Analysis Intelligence Index上拿到52分,与GPT-5.6 Luna(max)打平,只比GLM-5.2(max,753B参数)和DeepSeek V4 Pro 0813(max,标注1.6B参数)低1分。这份对比乍看是开源小模型效率革命的又一个注脚,细看却有一处绕不过去的疑点:Willison用来当参照系的那几个对手,公开信息里几乎找不到实证。
27B对753B,差距悬殊到反常
先把账面数字摆清楚。Qwen 3.8 27B以27B参数拿52分,GLM-5.2标注753B参数拿53分,两者相差整整一个数量级,跑分却只差1分。这正是Willison称其"真正令人惊讶"的原因——如果这个对比成立,意味着参数规模在这项综合指数上的边际收益已经薄到可以忽略。
但账面里还有一个更古怪的细节:DeepSeek V4 Pro被标注为1.6B参数,同样拿到53分。1.6B是手机能跑的量级,如果这个数字准确,那它比Qwen还小17倍,跑分反而更高——这种反差比"27B平753B"更值得怀疑,大概率是激活参数与总参数的混淆,或者原文本身的笔误,而不是真的存在一个1.6B就能打满血大模型的奇迹。
- 风险.跑分对比里出现的具体参数标注(尤其是1.6B这类极端数字)应当先打个问号,再当结论使用。
核实卡在了对比对象本身
按行业惯例,一份跨模型跑分对比,最基本的前提是对比对象真实存在、规格可查。但联网核实GPT-5.6、Luna、GLM-5.2、DeepSeek V4 Pro这几个具体型号名称时,找不到能对上号的公开发布信息——检索工具明确提示这些不是可靠识别的当前发布版本,更接近的已知型号是GPT-5系列和GLM-4.5/4.6这类命名。
这不代表原文在编造数字,更可能的解释是信息时滞:文章的发布时间设定在2026年8月,这些型号或许是那个时间点刚发布、尚未被广泛收录的新版本,也可能存在占位性质的命名习惯。但对读者来说,结论很直接:看到"27B打平巨兽"这种反差标题,先查对手是谁,再决定要不要转发。
跑分对比的说服力,取决于对比对象能不能被验证,而不是分差有多小。
高分和"能不能用"是两回事
即便52分这个数字站得住,它也回答不了"这个模型好不好用"。Willison自己在前一天的文章里给Qwen 3.8 27B贴了另一个标签:"优秀,但严重过度思考"——遇到简单问题也会绕一大圈推理链路才给答案,这意味着实际部署时的响应延迟和token消耗,可能远比跑分数字暗示的更高。
这揭示了Artificial Analysis Intelligence Index这类复合指数的固有局限:它把推理、知识、代码、数学、指令遵循揉成一个数字,方便横向比较,但推理模式、上下文长度、量化方式、评测时的思考步数都会影响最终得分。跨数量级参数比较本身在业内也有方法论争议——是否该按参数量分层评测,至今没有共识。
对准备把开源小模型放进生产环境的团队来说,这份跑分值得当作一个初筛信号,而不是选型依据。真正要看的是:同样的任务,27B模型跑一次要多久、烧多少token、和753B级别的模型比综合成本谁更划算——这些答案,跑分榜单一个都给不出来。
