OpenAI在8月24日宣布,新一代GPT-5.6模型家族——Sol、Terra、Luna——正式接入AWS旗下的AI编程智能体Kiro。双方联合测试给出的说法是:在Terminal-Bench 2.1这项基准上,Terra模型在Kiro中完成任务的成本降低了约82%。这个数字很抓眼球,但拆开看,它更像一句营销结论,而不是一份可核实的测试报告。

82%降在哪,官方没说清

Terminal-Bench 2.1是业内常用的智能体编程能力测试集,跑的是真实终端任务。但OpenAI和AWS这次只给了一个百分比,没说清对比的基线是哪个模型、哪种配置,没说清"成本"指的是token计费、Kiro内部的credit消耗,还是端到端的总执行成本,也没交代跑了多少次、置信区间是多少。

容易被混着看的还有另一组数字:OpenAI自己公布的GPT-5.6通用评测里,Terra在Terminal-Bench 2.1的得分是87.4%,Sol是88.8%,Luna是84.7%,作为对照的上一代GPT-5.5是85.6%。这是模型的通用能力评测,衡量的是"能不能做对",跟Kiro里"做对一次要花多少钱"完全是两件事,不该被当成同一份成绩单来读。

唯一经得起核对的数字,来自另一个框架

行业里确实存在一份可独立复核的Terminal-Bench 2.1成绩单——只不过用的是Codex框架,不是Kiro。这份由Terminal-Bench团队复核过的提交显示,Codex搭配GPT-5.6 Terra(最大推理强度)跑了445次试验(89个任务、每个5次尝试),得分78.4%±1.3%,总花费421.15美元。折算下来,每次试验约0.95美元,每个任务(含5次尝试)约4.73美元,每次成功的试验约1.21美元。

这组数字之所以值得拿出来对照,不是因为它能证明或推翻Kiro的82%,恰恰相反——因为智能体的执行框架(agent scaffolding)不同,成功率和token消耗都会跟着变,Codex的成本结构套不到Kiro头上。但它展示了"什么叫可审计的成本数据":基线明确、次数明确、总花费明确。相比之下,Kiro那句"降低约82%",更像是省略了方法论的结论。

两种"成本数字"的可信度差距 OpenAI × AWS 官方联合声明 82% Terra在Kiro中的任务成本降低 无基线 · 无口径 · 无次数披露 不可独立复核 Terminal-Bench团队复核的Codex测试 $1.21 每次成功试验的花费(445次试验实测) 总花费$421.15 · 89任务×5次尝试 方法论透明,但框架非Kiro

定价文档跟不上定价公告

更能说明"厂商公告"和"产品执行"之间有落差的,是Kiro自己的定价页面。OpenAI在7月30日下调了Terra和Luna的API价格,Kiro随后把这两款模型的credit倍率分别从1.2倍、0.6倍降到1.0倍、0.1倍。但8月21日OpenAI又把Sol的价格降到输入4美元、输出20美元每百万token(这个促销价至少维持到11月21日),Kiro的credit倍率页面上,Sol至今仍标着旧的2.4倍。

这不是什么大事故,但足以提醒使用者:厂商联合公告的发布时间,往往跑在产品实际落地前面。企业采购和技术负责人如果拿着新闻稿里的价格去算预算,很可能算的是一个还没同步到账单系统里的数字。

  • 提醒.credit倍率与token定价之间存在同步延迟,实际扣费应以Kiro账单为准,而非公告口径。

开发者社区的反馈也不算统一。有人认可Kiro的spec-driven流程——先把需求拆成结构化的设计文档和任务清单,再让模型逐步实现,这确实能减少来回试错。但也有开发者在社群里直接反映,GPT-5.6 Sol在Kiro里的表现"令人失望"。样本小、不构成基准,但至少说明官方叙事和一线体验之间不是完全对齐的。


Kiro的核心卖点从来不是"哪个模型更强",而是"先想清楚再动手"的流程设计。这和Claude Code、Cursor、GitHub Copilot走的是不同路线——前者靠终端集成、后两者靠IDE原生体验和生态位置。学术圈已有研究比较过这几类编程智能体,结论是没有谁能在所有任务类型上都占优,各家排名会随任务性质大幅波动。放在这个坐标里看,Kiro"代码质量更高"的说法,更接近工作流层面的差异化主张,而不是一个已经被验证的模型级结论。

真正值得盯的,不是这次82%的数字本身,而是接下来OpenAI和AWS是否会公开测试方法论、是否会有第三方复现Kiro场景下的成本对比、以及Kiro的定价文档能不能追上自己的合作公告。这三件事任何一件发生,才算是把"营销数字"变成"可核对的事实"。