xAI在2026年9月21日推出了面向代码与长流程任务的新模型Grok 4.7,并在公告中维持了极具攻击性的标价:输入端每百万token $2,输出端每百万token $6。
官方宣称它在CursorBench 4.0达到46.3%,在Terminal-Bench 4.0达到38.0%,同时配备了穿透率仅3.3%的新安全防护栈。表面上看,xAI像是用腰斩甚至只有行业顶尖方案几分之一的标价,直接叫板Anthropic定价高达输入$10、输出$50的Claude Fable 5.1。但顺着开发者的实际调用账单和评测平台数据看下去,这场平价风暴并没有通告写的那么单纯。
官方榜单与独立实测的温差
xAI这次的宣发把重点押在了多小时自主编程与长流程工作上。官方博客给出的基准测试非常扎眼:CursorBench 4.0拿到46.3%,DeepSWE v1.1拿到71.0%,Terminal-Bench 4.0拿到38.0%。

然而在Cursor官方运营的CursorBench 4.0独立榜单上,Grok 4.7在高思考配置下的真实成绩为43.9%,相比官方宣传回落了2.4个百分点,单任务成本为$4.69。在Artificial Analysis Index v4.3.2综合指数里,Claude Fable 5.1录得53分,GPT-5.6 Sol为47分,Grok 4.7以46分紧随其后。
更关键的问题在于归因。在DeepSWE v1.1与Terminal-Bench 4.0官方公开发布的排行榜上,目前均没有独立收录Grok 4.7,官方所列的跑分依然属于厂商自测。
此外,Terminal-Bench这类测试衡量的是完整模型加宿主框架的工程流水线,例如Fable 5.1需要搭配Claude Code拿到57.9%,GPT-5.6 Sol搭配Codex拿到37.3%。xAI在测试中直接接入了Grok Bot调度脚手架,把框架工程红利折算成模型本身的纯智力,这是评测宣传里常见的障眼法。
名义标价与真实开销的账本
很多开发者看到每百万token $2与$6的数字时,会以为开发成本能降下来一大截。但大模型写代码的开销结构,从来不是只由单价决定的。

根据Cursor社区首批接入者的实际反馈,Grok 4.7为了强化自验证机制与复杂推理,在实际任务中消耗的思考token数量激增,整体耗时也成倍延长。这说明模型在后台反复自我辩驳、验证上下文,把计算量大量转化为输出思考的内部损耗。
| 模型 | 输入定价 / 1M | 输出定价 / 1M | CursorBench 4.0 | AA Index 综合分 |
|---|---|---|---|---|
| Grok 4.7 | $2 | $6 | 43.9%(实测) | 46 |
| GPT-5.6 Sol | $4 | $20 | 41.7% | 47 |
| Claude Fable 5.1 | $10 | $50 | 51.8% | 53 |
名义单价虽然低,但输出token数量成倍放大后,按单任务实际交付结算的费用并没有展现出压倒性优势。CursorBench实测单任务成本达到$4.69,就是这种机制的注脚。
名义上的低廉若靠数倍的隐性计算来代偿,账单终究会找上门来。
- 风险.如果按固定预算给自主Agent分配配额,Grok 4.7在重度排错与长任务中容易耗尽思考额度,导致任务超时或费用超出预期。
隐蔽的限制与生态算力算盘
除开跑分与Token消耗,开发者在接入文档里还能发现几道微妙的门槛。

API文档标注Grok 4.7拥有500,000-token的上下文窗口,提供low、medium、high、xhigh四档可配置推理深度。然而,官方宣称响应速度翻倍的Fast变体,在开发者文档中明确注明仅限Cursor与自家Grok Build平台内调用,暂时不通过公共API提供。
与此同时,文档的计费细则显示,选择US区域端点会被额外收取10%的价格溢价。把高速变体扣留在私有生态与战略合作方内部,公有接口加收区位溢价,这暴露出xAI在支撑长流程重负载时,底层的算力供给并非游刃有余。
安全宣称上同样留有模糊地带。官方声称HackerBench v0.3风险穿透率仅3.3%,生物安全达62.4%,但这些指标很大程度依赖自研标准,没有公开具体的误拒率,而且发布至今并未随附一份经过同行审查的Model Card安全技术白皮书。官网上频繁出现的SpaceXAI混合称谓,也反映出组织资源与品牌体系还在整合期。
- 结论.对于企业技术选型而言,不要被初始标价绑架,应在Cursor等工具中以真实代码仓合并率为唯一标尺,观察DeepSWE等第三方榜单复现结果后再决定迁移。
长流程软件工程的竞赛已经脱离了简单的单句补全,进入到拼耐力、拼架构调度的深水区。模型厂商用超长思考和自建脚手架来拔高跑分,本是工程演进的必然;但在宣发时一边淡化思考Token膨胀,一边高呼降价,就免不了带上几分营销算计。天下熙熙皆为利来,名义价格永远只是表象,端到端的有效解决率,才是开发者最终要支付的真实对价。
