Anthropic 刚发布 Claude Opus 5.5 仅 90 分钟,OpenAI 就把 GPT-6 Sol 和 Luna 推上了前台。
这绝非底层智能的顿悟式代际跃迁,而是一场踩着对手脚后跟发起的刺刀战。OpenAI 内部原本将两款模型归在 GPT-5.6 序列,上线当天临时冠以 GPT-6 标签。这一动作的意图很直白:用腰斩一半的 API 标价,打乱对手的节奏,把开发者的预算死死锁在自己的账户里。
但当仔细核对账本时,这场看似诱人的半价促销,不仅藏着长上下文的跳价暗门,还在工程交付上埋了账单陷阱。
标价腰斩背后的算力账与跳价暗门
从纸面牌价看,OpenAI 的定价策略极具攻击性。两款新模型均具备 1.05M 上下文窗口与 128K 输出窗口,支持从 none 到 max 的推理档位调节,目前暂不支持微调。

GPT-6 Sol 的输入与输出价格分别为每百万 token 2 美元和 10 美元,恰好是同日问世的 Claude Opus 5.5(4 美元与 20 美元)的整整一半。极轻量级的 GPT-6 Luna 输出价格从旧款的 1.20 美元降到 0.50 美元,降幅达到 58.3%,比 Gemini 3.8 Flash 的促销价便宜了数倍。
| 模型 | 标准输入 (每 1M token) | 超过 272K 输入 | 标准输出 | 超过 272K 输出 | 相对前代降幅 |
|---|---|---|---|---|---|
| GPT-6 Sol | $2.00 | $4.00 | $10.00 | $15.00 | 50.0% |
| GPT-6 Luna | $0.10 | $0.20 | $0.50 | $0.75 | 58.3% |
| Claude Opus 5.5 | $4.00 | 未设阶梯加价 | $20.00 | 未设阶梯加价 | - |
标价牌很美,但计费规则里藏着一道清晰的阶梯分水岭。一旦单次请求的输入量跨过 272K tokens,计费系统会自动切入高阶费率。届时 Sol 的输入与输出价格立刻跃升至 4 美元与 15 美元,Luna 也会翻倍至 0.20 美元与 0.75 美元。对于依赖长轮次日志排查或整库代码扫描的工程场景,标价腰斩的优惠在长文本阶段瞬间失效。
标准短上下文下,Sol 与 Luna 的缓存输入可享受 90% 折扣,结合上下文前缀断点工具,能显著压低多轮交互开销。OpenAI 披露的一组内部数据道出了压低单价的缘由:在长程编码 Agent 场景中,内部中位数研究员每日 token 消耗超 600 美元,前 10% 的高频用户日消耗更是突破 7,000 美元。连续工作流的普及,让模型开销变成了必须精打细算的生产耗材。
特挑考卷、统计剪裁与交付异化
官方宣称 GPT-6 Sol 的事实性错误比前代减少了一半,跑分全面碾压竞品。然而细看基准对比与安全文档,数据掺杂了明显的口径调整。

官方宣称的错误减半,评测集主要选自历史真实用户的投诉纠错样本库。模型只是针对已知踩坑场景强化了规避能力,并不代表在通用生产环境中的真实幻觉率同步减半。
在基准对比上,裁量手段更密集。在业务自动化基准 AutomationBench 1.0.6 评测中,官方称 GPT-6 Sol 得分 33.2%,单任务成本仅需 0.27 美元。而在对比 Anthropic 阵营时,官方直接剔除了其机制中约 40% 自动回退到旗舰模型的高额成本,甚至在缺少最新数据时直接取上一代模型充数。
实际工程基准也存在偏差。DeepSWE v1.1 近期将评分机制从 exit-code 换为 node-ID 校验,测试线缆的变更直接引起了数个百分点的评分漂移。Sol 跑出的 68.8% 在社区复测中稳定性欠佳。而在长程桌面基准 OSWorld 2.0 离线测试中,Sol 拿到 60.5% 分数看似与 Opus 5 打平,但旗舰 Astra 约 40 分钟即可完成,Sol 却耗时长达 75 分钟。
更致命的是交付形态的倒退。早期工程汇总显示,Sol 在 GDPval 任务上的评分相比前代大跌约 100 Elo。它很少犯低级语法错误,却表现出严重的过度工程化倾向:为了通过几个边缘测试用例,它会在内部推理中不断兜圈子,甚至最终遗漏了用户最初要求的核心业务逻辑与交付物。
冗余废话推高总账,真实博弈在分层路由
决定真实开发成本的往往不是价目表,而是模型在思考循环里吐出的冗余废话。

在 Zapier 的独立评测中,Claude Opus 5.5 成功率为 40.0%,单任务开销 1.28 美元,折合单次成功交付需 3.20 美元;GPT-6 Sol 成功率虽仅 33.2%,但单任务开销只有 0.27 美元,单次成功交付成本压至 0.81 美元。尽管在复杂推理的绝对天花板上 Claude 依然稳固,但 Sol 把中等难度任务的试错代价拉低了四分之三。
Snorkel ALE 基准对 147 项复杂专业任务的测试进一步印证了这种消耗反差。Opus 5 跑完整套任务吞掉了 1.8B 输入 token 与 10.1M 输出 token,单任务成本高达 11.14 美元;而 Sol 仅消耗 762.9M 输入与 3.8M 输出,单任务成本降至 5.25 美元;轻量级 Luna 甚至只需 1.60 美元。
十九世纪铁路大战期间,范德比尔特与古尔德大打运价战,把纽约到芝加哥的运费一路腰斩,却在转运与仓储环节立起名目繁多的加价条约。今天的基础模型也在重演同一出戏本:表面上降价 50%,暗地里用 272K 跳价和长程冗余 Token 默默收回利润。
面对这种利益算计,指望单挑某个神仙模型接管全流程的人,注定要为冗余开销埋单。工业级的应对方案已转向复合路由分工。
工业化取舍:便宜耗材与返工代价
成熟的工程团队不会把全部身家押在一次突击降价上。

每百万 token 仅 0.10 美元、输出速度达 157 tps 的 Luna,是极佳的低成本耗材。它适合嵌在日志预处理、字段提取和前置重试管线里,用来消化 80% 的外围噪音。但遇到跨模块架构设计或复杂约束时,Sol 的漏单倾向会变成极为昂贵的人肉返工成本。
天下熙熙,皆为利来。这轮腰斩降价撕掉了大模型发布会的科研滤镜,露出了算力消耗战的底色。工程决策者的核心指标不再是某个模型有多聪明,而是调度系统能否用最低成本换来一次完整的确定性交付。
贪图纸面便宜而忽视交付缺陷,无异于买椟还珠。在这场价格混战里,算清隐性跳价与返工总损耗的人,才能真正拿到算力降价的红利。
