评测机构Artificial Analysis(AA)刚发了一份报告:xAI的Grok 4.6在其Intelligence Index上拿到61分,比一个月前的Grok 4.5涨了5分,比更早的Grok 4.3涨了23分,和GPT-5.6 Sol打平,落后Claude Opus 5(63分)、Claude Fable 5(62分)一点点,刚好领先Kimi K3。更抓眼球的是价格:定价维持Grok 4.5的每百万token输入2美元、输出6美元不变,单任务成本测算下来是0.84美元,和Kimi K3一样便宜,但智能分数更高。

这套叙事很好懂:分数涨了,价格没涨,"性价比之王"的标题几乎是自动生成的。但把这份报告翻到细节,会发现它讲清楚了"发生了什么",却没讲清楚"这些数字是怎么算出来的"——而这恰恰是判断它能不能信的关键。

61分和0.84美元,是怎么来的

Grok 4.6的强项集中在agentic(智能体)任务上,而不是静态推理。在AA自家的GDPval-AA v2上,它的Elo达到1753,仅次于Claude Opus 5,和Claude Fable 5、Qwen3.8 Max的置信区间有重叠,统计上分不出高下。多轮客服工具调用测试τ³-Banking上,它拿到50.7%,并列第二。终端任务测试Terminal-Bench v2.1上是88.4%,和头部选手在同一水平线。

真正让人多看一眼的是长程任务的效率。在AA的私有基准AA-Briefcase上,Grok 4.6的Elo是1577,属于Fable 5同档,落后Claude Opus 5家族。但它平均只用约53轮对话、0.5B输入token就能完成任务,而Claude Opus 5(max)要跑103轮、消耗2.0B输入token。轮次少一半,输入token只要四分之一——这个差距,比单纯的Elo分数更能说明实际使用中的成本差异。

长程任务效率对比:轮次与输入token 对话轮次 Grok 4.6: ~53轮 Claude Opus 5: ~103轮 输入token Grok 4.6: ~0.5B Claude Opus 5: ~2.0B 数据来源: Artificial Analysis AA-Briefcase基准 说明: 长程任务中,轮次和token消耗直接决定实际使用成本

"0.84美元"没说的那部分

问题出在"cost per task"这个指标本身。行业里给模型排"性价比"的常见做法,是拿基准得分除以单价,得出一个看起来很直观的数字。但这个算法有个硬伤:基准分数不是完成工作量的单位,不同模型的token消耗方式也不一样,准确率的提升更不是线性的——从90分冲到98分,和从50分冲到58分,同样涨8分,背后的难度和价值完全不是一回事。

一个真正靠得住的成本对比,至少要交代清楚:模型的精确版本快照和推理强度设置、完全一致的任务执行框架、pass@1和pass@k的区分、延迟的中位数和尾部延迟、置信区间和样本量、公开基准是否存在数据污染、任务级结果而不是只给平均值,以及实际计费成本而不是靠可见输出估算的token数。AA这份报告里,0.84美元这个数字有没有把重试、工具调用、失败后的复核成本算进去,报告本身没说。

  • 风险.如果0.84美元只是"分数除以单价"的简化算法,而没有纳入重试和失败成本,这个"性价比第一"的结论就站不住脚。
一个可信的cost per task,需要披露什么 模型快照+推理强度设置 pass@1与pass@k区分 置信区间+样本量 实际计费成本(非估算) 重试+工具调用费用 任务级结果,非只看平均值 AA本次报告未明确说明是否覆盖上述项目 "分数除以单价"式计算,忽略了准确率提升的非线性价值

一份连主体名字都没写对的报告

除了方法论空白,这份报告自身也留了几个疑点。原文把xAI写成"SpaceXAI"——马斯克旗下的xAI和SpaceX是姊妹公司,不是同一实体,这个命名要么是笔误,要么就有更值得核实的地方。报告落款日期是2026年8月12日,里面提到的Claude Opus 5、GPT-5.6 Sol、Qwen3.8 Max等型号,目前也缺乏公开可查的确切API快照ID和发布记录。"Sol"这个后缀本身就有歧义,不清楚指的是模型、agent脚手架,还是某个评测套件的名字。

跑分是分数,不是账本;账本没晒出来,分数就只能算参考。

这些疑点不代表Grok 4.6的表现完全不可信,但意味着这篇被广泛引用的"基准测试新闻",在拿去做采购决策依据之前,至少应该被追问一遍:模型版本是哪个快照?测试框架是否一致?样本量够不够?

谁该多看一眼

企业技术选型的人如果只看AA的排行榜下单,风险在于把"分数除以价格"当成了真实业务里的性价比。真实场景里,失败任务的复核成本、多轮工具调用的额外计费,往往比单价差异更能决定总成本。对xAI而言,"重返前沿+成本领先"这套双重标签对融资叙事和客户拓展都很有用,但公司本身还没有就报告里"SpaceXAI"的命名和相关跑分细节做出公开回应。

接下来值得盯的,是AA是否会补充公开模型快照信息、测试框架和置信区间数据——这决定了这份榜单能不能真正成为行业公信力的基准,而不只是一份好看的排名表。