Anthropic 刚发布 Claude Opus 5.5 仅 90 分钟,OpenAI 就把 GPT-6 Sol 和 Luna 推上了前台。

这绝非底层智能的顿悟式代际跃迁,而是一场踩着对手脚后跟发起的刺刀战。OpenAI 内部原本将两款模型归在 GPT-5.6 序列,上线当天临时冠以 GPT-6 标签。这一动作的意图很直白:用腰斩一半的 API 标价,打乱对手的节奏,把开发者的预算死死锁在自己的账户里。

但当仔细核对账本时,这场看似诱人的半价促销,不仅藏着长上下文的跳价暗门,还在工程交付上埋了账单陷阱。

标价腰斩背后的算力账与跳价暗门

从纸面牌价看,OpenAI 的定价策略极具攻击性。两款新模型均具备 1.05M 上下文窗口与 128K 输出窗口,支持从 none 到 max 的推理档位调节,目前暂不支持微调。

九成输入缓存折扣与前缀断点压多轮历史开销(剖面示意)
九成输入缓存折扣与前缀断点压多轮历史开销(剖面示意)

GPT-6 Sol 的输入与输出价格分别为每百万 token 2 美元和 10 美元,恰好是同日问世的 Claude Opus 5.5(4 美元与 20 美元)的整整一半。极轻量级的 GPT-6 Luna 输出价格从旧款的 1.20 美元降到 0.50 美元,降幅达到 58.3%,比 Gemini 3.8 Flash 的促销价便宜了数倍。

模型标准输入 (每 1M token)超过 272K 输入标准输出超过 272K 输出相对前代降幅
GPT-6 Sol$2.00$4.00$10.00$15.0050.0%
GPT-6 Luna$0.10$0.20$0.50$0.7558.3%
Claude Opus 5.5$4.00未设阶梯加价$20.00未设阶梯加价-

标价牌很美,但计费规则里藏着一道清晰的阶梯分水岭。一旦单次请求的输入量跨过 272K tokens,计费系统会自动切入高阶费率。届时 Sol 的输入与输出价格立刻跃升至 4 美元与 15 美元,Luna 也会翻倍至 0.20 美元与 0.75 美元。对于依赖长轮次日志排查或整库代码扫描的工程场景,标价腰斩的优惠在长文本阶段瞬间失效。

标准短上下文下,Sol 与 Luna 的缓存输入可享受 90% 折扣,结合上下文前缀断点工具,能显著压低多轮交互开销。OpenAI 披露的一组内部数据道出了压低单价的缘由:在长程编码 Agent 场景中,内部中位数研究员每日 token 消耗超 600 美元,前 10% 的高频用户日消耗更是突破 7,000 美元。连续工作流的普及,让模型开销变成了必须精打细算的生产耗材。

GPT-6 梯队 API 标价与降幅对照 (每 1M Token) GPT-6 Sol -50.0% 输入: $4 → $2 输出: $20 → $10 GPT-6 Luna -58.3% 输入: $0.20 → $0.10 输出: $1.20 → $0.50

特挑考卷、统计剪裁与交付异化

官方宣称 GPT-6 Sol 的事实性错误比前代减少了一半,跑分全面碾压竞品。然而细看基准对比与安全文档,数据掺杂了明显的口径调整。

评测底层测试线缆更换直接引发软件跑分漂移
评测底层测试线缆更换直接引发软件跑分漂移

官方宣称的错误减半,评测集主要选自历史真实用户的投诉纠错样本库。模型只是针对已知踩坑场景强化了规避能力,并不代表在通用生产环境中的真实幻觉率同步减半。

在基准对比上,裁量手段更密集。在业务自动化基准 AutomationBench 1.0.6 评测中,官方称 GPT-6 Sol 得分 33.2%,单任务成本仅需 0.27 美元。而在对比 Anthropic 阵营时,官方直接剔除了其机制中约 40% 自动回退到旗舰模型的高额成本,甚至在缺少最新数据时直接取上一代模型充数。

实际工程基准也存在偏差。DeepSWE v1.1 近期将评分机制从 exit-code 换为 node-ID 校验,测试线缆的变更直接引起了数个百分点的评分漂移。Sol 跑出的 68.8% 在社区复测中稳定性欠佳。而在长程桌面基准 OSWorld 2.0 离线测试中,Sol 拿到 60.5% 分数看似与 Opus 5 打平,但旗舰 Astra 约 40 分钟即可完成,Sol 却耗时长达 75 分钟。

更致命的是交付形态的倒退。早期工程汇总显示,Sol 在 GDPval 任务上的评分相比前代大跌约 100 Elo。它很少犯低级语法错误,却表现出严重的过度工程化倾向:为了通过几个边缘测试用例,它会在内部推理中不断兜圈子,甚至最终遗漏了用户最初要求的核心业务逻辑与交付物。

真实任务经济学:Zapier AutomationBench 成本结构 GPT-6 Sol (XHigh) 任务成功率: 33.2% 单次运行成本: $0.27 $0.81 / 成功任务 Claude Opus 5.5 (Max) 任务成功率: 40.0% 单次运行成本: $1.28 $3.20 / 成功任务

冗余废话推高总账,真实博弈在分层路由

决定真实开发成本的往往不是价目表,而是模型在思考循环里吐出的冗余废话。

思考过程中的冗余生成直接推高了最终交付账单(示意图)
思考过程中的冗余生成直接推高了最终交付账单(示意图)

在 Zapier 的独立评测中,Claude Opus 5.5 成功率为 40.0%,单任务开销 1.28 美元,折合单次成功交付需 3.20 美元;GPT-6 Sol 成功率虽仅 33.2%,但单任务开销只有 0.27 美元,单次成功交付成本压至 0.81 美元。尽管在复杂推理的绝对天花板上 Claude 依然稳固,但 Sol 把中等难度任务的试错代价拉低了四分之三。

Snorkel ALE 基准对 147 项复杂专业任务的测试进一步印证了这种消耗反差。Opus 5 跑完整套任务吞掉了 1.8B 输入 token 与 10.1M 输出 token,单任务成本高达 11.14 美元;而 Sol 仅消耗 762.9M 输入与 3.8M 输出,单任务成本降至 5.25 美元;轻量级 Luna 甚至只需 1.60 美元。

十九世纪铁路大战期间,范德比尔特与古尔德大打运价战,把纽约到芝加哥的运费一路腰斩,却在转运与仓储环节立起名目繁多的加价条约。今天的基础模型也在重演同一出戏本:表面上降价 50%,暗地里用 272K 跳价和长程冗余 Token 默默收回利润。

面对这种利益算计,指望单挑某个神仙模型接管全流程的人,注定要为冗余开销埋单。工业级的应对方案已转向复合路由分工。

工程落地的三层动态路由架构 顶层裁决: Astra 复杂规划、架构设计 最终结果仲裁与兜底 低频调用 · 保上限 主干执行: Sol 深度编码、工具链串联 中长程多步骤求解 中频主力 · 抓产出 批量轮询: Luna 单步纠错、海量重试 前置分类、数据搬运 高频重试 · 压总账

工业化取舍:便宜耗材与返工代价

成熟的工程团队不会把全部身家押在一次突击降价上。

多层路由架构按规划执行与试错进行工业化分流
多层路由架构按规划执行与试错进行工业化分流

每百万 token 仅 0.10 美元、输出速度达 157 tps 的 Luna,是极佳的低成本耗材。它适合嵌在日志预处理、字段提取和前置重试管线里,用来消化 80% 的外围噪音。但遇到跨模块架构设计或复杂约束时,Sol 的漏单倾向会变成极为昂贵的人肉返工成本。

天下熙熙,皆为利来。这轮腰斩降价撕掉了大模型发布会的科研滤镜,露出了算力消耗战的底色。工程决策者的核心指标不再是某个模型有多聪明,而是调度系统能否用最低成本换来一次完整的确定性交付。

贪图纸面便宜而忽视交付缺陷,无异于买椟还珠。在这场价格混战里,算清隐性跳价与返工总损耗的人,才能真正拿到算力降价的红利。