同一个 GPT-5.6 家族,OpenAI 给出了两种方向相反的价格动作:Luna 和 Terra 降价,Sol 则增加一条两倍价格的 Fast mode。
便宜的负责吞规模,昂贵的负责抢时间。OpenAI 正在把“模型有多聪明”拆成一张更细的价目表:智能、速度和成本,各自计价。
Luna 降价 80%,Sol 只给速度加价
信息来自 OpenAI 发布的《Advancing the price-performance frontier with GPT-5.6》。按公告,价格调整如下:
| 模型或模式 | 价格变化 | API 价格 | 具体规则 |
|---|---|---|---|
| GPT-5.6 Luna | 降价 80% | 输入 0.20 美元、输出 1.20 美元/百万 token | 面向高频、批量任务 |
| GPT-5.6 Terra | 降价 20% | 输入 2 美元、输出 12 美元/百万 token | 位于成本与能力的中间档 |
| GPT-5.6 Sol 标准模式 | 不变 | 公告未在所给材料中列出具体单价 | 没有降价 |
| GPT-5.6 Sol Fast mode | 标准模式的 2 倍 | 按 Sol 标准价格加倍 | 速度最高提升 2.5 倍,官方称智能水平不变 |
按降幅倒推,Luna 调价前约为输入 1 美元、输出 6 美元;Terra 约为输入 2.50 美元、输出 15 美元。这里是根据官方降幅和新价格计算出的旧价,并非公告另行公布的一组数字。
Fast mode 取代原来的 Priority Processing。它没有提供更强的模型能力,只增加一条高价、低时延通道。“最高 2.5 倍”也不是稳定承诺,不能直接当成生产环境的 P95 延迟表现。
价格按官方原文于 7 月 30 日生效,所给材料未标明年份。AWS 端会滚动上线,不能理解成所有平台同一时刻完成切换。
ChatGPT Work 与 Codex 的订阅价格、额度预算不变。变化落在 credits 消耗上:使用 Luna、Terra 完成相同类型的调用,扣除的 credits 会减少。
直接受益的场景很具体:
- 批量读取、提取和整理文档;
- 客服工单分类、审核和路由;
- 常规代码生成、修改与测试;
- 大量重复、容错空间较高的后台任务。
普通 ChatGPT 用户未必会立刻感到差异。真正需要重新算账的,是企业 AI 工作流负责人和调用量较大的 API 团队。
企业要算的是整条工作流,不是单个模型
OpenAI 给出的建议很明确:不要让一个昂贵模型包办所有步骤。
一条企业工作流可以让 Sol 做规划、判断和复杂决策,再把拆好的任务交给 Luna 批量执行。Terra 留在中间,承接那些 Luna 不够稳、又没必要动用 Sol 的环节。
这比“所有请求都换成便宜模型”现实得多。
例如,一批合同需要处理。Sol 可以先识别风险条款、决定提取规则,Luna 再完成数千份文档的字段抽取和格式整理。企业购买的已经不是某个模型的单次回答,而是一条由多个模型、工具和校验环节拼起来的生产线。
OpenAI 称,Luna 能以约一年前前沿模型每任务 6% 的成本、接近九倍的速度,完成相近工作。这个数字很亮眼,但它来自 OpenAI 自测或估算。测试任务、质量阈值、上下文长度以及工具调用条件,在现有材料里并不完整。
“相近工作”也不等于所有任务质量相同。
企业最终支付的每任务成本,大致还要算上这些部分:
token 费用 + 工具调用 + 重试消耗 + 人工校正 + 路由与工程维护
如果 Luna 单次调用便宜了,但错误率导致更多重试,或者团队需要重写提示词、评测和路由逻辑,账单降幅会小于 80%。在部分复杂流程里,工程成本甚至会暂时盖过 token 节省。
如果你负责企业工作流,最现实的动作不是立刻全量迁移,而是拿一段真实流量做并行测试,至少记录四项指标:
- 每个成功任务的总成本,而非每百万 token 单价;
- P50 与 P95 延迟,而非宣传中的最高速度;
- 重试率、工具调用失败率;
- 人工返工时间和最终完成率。
Fast mode 也很好判断。只有当等待会阻塞后续流程、影响实时交互,或者延迟损失高于额外模型费用时,两倍价格才合理。夜间批处理、离线文档整理、非紧急代码任务,通常没有必要为它买单。
模型进入货架,平台开始争夺调度权
云计算早就走过类似的路。相近的计算资源被拆成按需、预留、抢占式实例,客户表面上在买服务器,实际在学习如何调度成本、容量和可用性。
今天的模型市场并不完全一样。模型质量更难测,输出也不像 CPU 时间那样稳定。但重复出现的商业结构很清楚:当基础能力逐渐标准化,厂商就会把价格梯度做得更细,让客户按任务价值购买不同档位。
OpenAI 这轮动作做对了一件事:它承认企业不需要每一步都调用最强模型。
过去的发布叙事总在强调榜单、参数和能力上限。企业真正头疼的却是另一套问题:一天跑几十万次任务要花多少钱,延迟能否卡进业务流程,失败后要重试几次,换模型会不会牵动整条工具链。
Luna 降价 80%,是在抢这些高频调用。Sol 的 Fast mode,则把愿意为时间付费的请求单独挑出来。一个吞规模,一个卖时延,两端都能收钱。
我更在意的,是平台由此获得的调度位置。模型选择、请求路由、credits 计费和订阅产品逐渐连在一起后,企业迁移的对象就不再是一条 API,而是一套工作流。单个模型越像商品,承载路由、评测、权限和账单的平台越难替换。
当然,这套定价能否成立,还要看三个现实变量:Luna 在真实任务里的质量损失,Fast mode 的稳定延迟,以及跨模型路由是否真的省下总成本。任何一项不达标,漂亮的单价都会在重试和维护里被吃掉。
7 月 30 日之后,企业不该只盯着价格表。真正需要核对的,是一项任务从进入系统到被业务接受,究竟花了多少钱、等了多久、返工了几次。
模型便宜只是开场。谁能掌握整条工作流的调度,谁才拿走后面的利润。
