xAI在2026年9月21日推出了面向代码与长流程任务的新模型Grok 4.7,并在公告中维持了极具攻击性的标价:输入端每百万token $2,输出端每百万token $6

官方宣称它在CursorBench 4.0达到46.3%,在Terminal-Bench 4.0达到38.0%,同时配备了穿透率仅3.3%的新安全防护栈。表面上看,xAI像是用腰斩甚至只有行业顶尖方案几分之一的标价,直接叫板Anthropic定价高达输入$10、输出$50的Claude Fable 5.1。但顺着开发者的实际调用账单和评测平台数据看下去,这场平价风暴并没有通告写的那么单纯。

官方榜单与独立实测的温差

xAI这次的宣发把重点押在了多小时自主编程与长流程工作上。官方博客给出的基准测试非常扎眼:CursorBench 4.0拿到46.3%,DeepSWE v1.1拿到71.0%,Terminal-Bench 4.0拿到38.0%。

实测高分依赖外挂工程脚手架支撑,并非模型单体能力(示意图)
实测高分依赖外挂工程脚手架支撑,并非模型单体能力(示意图)

然而在Cursor官方运营的CursorBench 4.0独立榜单上,Grok 4.7在高思考配置下的真实成绩为43.9%,相比官方宣传回落了2.4个百分点,单任务成本为$4.69。在Artificial Analysis Index v4.3.2综合指数里,Claude Fable 5.1录得53分,GPT-5.6 Sol为47分,Grok 4.7以46分紧随其后。

CursorBench 4.0 与关键指标实测差异 xAI 官方宣称口径 CursorBench 4.0 46.3% DeepSWE 标注成绩 71.0% (厂商自测) 第三方独立实测口径 Cursor 官方独立排榜 43.9% 落差 -2.4% DeepSWE / Terminal 榜单 暂无独立收录 单任务成本实测 $4.69

更关键的问题在于归因。在DeepSWE v1.1与Terminal-Bench 4.0官方公开发布的排行榜上,目前均没有独立收录Grok 4.7,官方所列的跑分依然属于厂商自测。

此外,Terminal-Bench这类测试衡量的是完整模型加宿主框架的工程流水线,例如Fable 5.1需要搭配Claude Code拿到57.9%,GPT-5.6 Sol搭配Codex拿到37.3%。xAI在测试中直接接入了Grok Bot调度脚手架,把框架工程红利折算成模型本身的纯智力,这是评测宣传里常见的障眼法。

名义标价与真实开销的账本

很多开发者看到每百万token $2与$6的数字时,会以为开发成本能降下来一大截。但大模型写代码的开销结构,从来不是只由单价决定的。

名义单价虽低,但思考计算膨胀后实际调用成本并不占优(示意图)
名义单价虽低,但思考计算膨胀后实际调用成本并不占优(示意图)

根据Cursor社区首批接入者的实际反馈,Grok 4.7为了强化自验证机制与复杂推理,在实际任务中消耗的思考token数量激增,整体耗时也成倍延长。这说明模型在后台反复自我辩驳、验证上下文,把计算量大量转化为输出思考的内部损耗。

模型输入定价 / 1M输出定价 / 1MCursorBench 4.0AA Index 综合分
Grok 4.7$2$643.9%(实测)46
GPT-5.6 Sol$4$2041.7%47
Claude Fable 5.1$10$5051.8%53

名义单价虽然低,但输出token数量成倍放大后,按单任务实际交付结算的费用并没有展现出压倒性优势。CursorBench实测单任务成本达到$4.69,就是这种机制的注脚。

名义上的低廉若靠数倍的隐性计算来代偿,账单终究会找上门来。
  • 风险.如果按固定预算给自主Agent分配配额,Grok 4.7在重度排错与长任务中容易耗尽思考额度,导致任务超时或费用超出预期。

隐蔽的限制与生态算力算盘

除开跑分与Token消耗,开发者在接入文档里还能发现几道微妙的门槛。

公有接口收取特定区域溢价,且高速算力仅对内部生态开放
公有接口收取特定区域溢价,且高速算力仅对内部生态开放

API文档标注Grok 4.7拥有500,000-token的上下文窗口,提供low、medium、high、xhigh四档可配置推理深度。然而,官方宣称响应速度翻倍的Fast变体,在开发者文档中明确注明仅限Cursor与自家Grok Build平台内调用,暂时不通过公共API提供。

Grok 4.7 访问权限与计费链路分化 公有开放 API 基础版本调用 无 Fast 变体通道 US 端点溢价 10% 受限专属平台 Cursor / Grok Build 独占 Fast 两倍速版本 捆绑自研调度环境 安全与合规黑盒 未公开 Model Card HackerBench 为内部测试 SpaceXAI 混合称谓

与此同时,文档的计费细则显示,选择US区域端点会被额外收取10%的价格溢价。把高速变体扣留在私有生态与战略合作方内部,公有接口加收区位溢价,这暴露出xAI在支撑长流程重负载时,底层的算力供给并非游刃有余。

安全宣称上同样留有模糊地带。官方声称HackerBench v0.3风险穿透率仅3.3%,生物安全达62.4%,但这些指标很大程度依赖自研标准,没有公开具体的误拒率,而且发布至今并未随附一份经过同行审查的Model Card安全技术白皮书。官网上频繁出现的SpaceXAI混合称谓,也反映出组织资源与品牌体系还在整合期。

  • 结论.对于企业技术选型而言,不要被初始标价绑架,应在Cursor等工具中以真实代码仓合并率为唯一标尺,观察DeepSWE等第三方榜单复现结果后再决定迁移。

长流程软件工程的竞赛已经脱离了简单的单句补全,进入到拼耐力、拼架构调度的深水区。模型厂商用超长思考和自建脚手架来拔高跑分,本是工程演进的必然;但在宣发时一边淡化思考Token膨胀,一边高呼降价,就免不了带上几分营销算计。天下熙熙皆为利来,名义价格永远只是表象,端到端的有效解决率,才是开发者最终要支付的真实对价。