同一款 GPT-5.6 Sol,智能水平不变,只把速度最高拉到2.5倍,OpenAI就收两倍价格。另一边,Luna直接降价80%。
这组定价比一次普通促销更有意思。OpenAI正在把模型能力拆成两门生意:大量、可等待的任务交给便宜模型;不能等的高价值场景,再为延迟单独付费。
Luna降80%,Sol标准价没涨
按OpenAI官方公告《Advancing the price-performance frontier with GPT‑5.6》,三档模型的价格变化如下。
| 模型或模式 | 调整前 | 调整后 | 适合的任务 |
|---|---|---|---|
| GPT-5.6 Luna | 输入1美元、输出6美元 | 输入0.20美元、输出1.20美元 | 分类、抽取、批量处理、高并发执行 |
| GPT-5.6 Terra | 输入2.50美元、输出15美元 | 输入2美元、输出12美元 | 需要更高质量,但仍要控制成本的任务 |
| GPT-5.6 Sol标准模式 | 原价 | 原价不变 | 复杂规划、推理和高价值任务 |
| Sol Fast mode | — | 标准模式的2倍价格 | 对响应时间敏感的交互与代理流程 |
表中价格均按每百万输入或输出token计算。Luna降幅为80%,Terra为20%。
Fast mode取代原来的Priority Processing,模型智能水平不变,官方称速度最高可达标准模式的2.5倍。由于现有材料没有给出Sol标准模式的具体单位价格,也没有列出旧Priority Processing的完整费率,无法严谨计算新旧加速服务的价差。
所以,Sol没有普遍涨价。OpenAI只是增加了一个可选的速度档。把它概括成“最贵模型加价”,会误导采购判断。
ChatGPT Work和Codex订阅的价格、额度预算也没有变化。不过,Terra和Luna现在消耗的credits更少。同样一笔订阅预算,可以跑更多批量任务。
直接受益的是高并发API客户。文档分类、客服工单识别、代码批量改写、数据抽取,这些任务对单次延迟不太敏感,却会吞掉大量token。Luna的降价会很快反映在账单上。
Token便宜了,任务未必便宜80%
用一笔简单的月度调用量计算:1亿输入token,加2000万输出token。
| 模型 | 调整前token费用 | 调整后token费用 | 节省 |
|---|---|---|---|
| Luna | 220美元 | 44美元 | 176美元 |
| Terra | 550美元 | 440美元 | 110美元 |
这是最直观的价格红利,也说明Luna为什么更适合规模化执行。调用量再放大,差额会更明显。
但采购部门不能拿“降价80%”直接乘企业AI总预算。
一个代理任务可能多次调用模型,还要处理长上下文、搜索、数据库、代码执行和其他工具费用。规划失败后重新尝试,token会继续增长。模型单价便宜了,如果工作流因此更敢消耗上下文、更频繁重试,最终账单可能只下降一部分。
OpenAI还给出两组很抢眼的官方数据:Luna的单任务成本约为一年前前沿模型的6%,速度接近其9倍;与Fable 5相比的成本优势,则来自Agents’ Last Exam测算。
这些数字只能放回对应基准里理解。包括“成本低近99%”之类的表述,都不等于所有业务能获得同样降幅。任务类型、提示词长度、成功率和评测方法一换,结果就可能变化。目前也没有独立测试足以把这些官方数字写成行业定论。
如果团队通过AWS等第三方渠道接入,还要核对实际生效时间、区域、合同价格和credits结算方式。公告价格不一定会在每条采购链路上同时落地。
智能开始商品化,延迟接过溢价
我更在意的是,OpenAI正在学习云计算行业最熟悉的一套做法。
同一类资源,按性能、时效和确定性分层收费。云服务器有按需、预留和竞价实例;电力有峰谷电价。模型市场现在也走到这一步:基础智能越来越便宜,及时交付却越来越贵。
两者不完全一样。模型输出存在随机性,复杂任务也很难像CPU时间那样准确计量。但背后的商业逻辑相通:成本下降后,不把全部效率红利交给客户,而是重新设计计价单位,把稀缺部分单独标价。
OpenAI公开强调模型、推理系统和代理框架的效率提升。现有信息不足以把降价归因于竞争压力、需求不足或财务状况。能够确认的只有一件事:它已经有能力把低价模型推向更大规模,同时保留旗舰模型的速度溢价。
“天下熙熙,皆为利来。”模型厂商不会只比谁的token更便宜。价格降到底之后,利润会转向延迟、稳定性、调度优先级和工作流锁定。
企业的采购方法也该跟着变。
| 相关团队 | 接下来最现实的动作 |
|---|---|
| 企业AI与API成本决策者 | 用真实调用日志重算单任务成本,拆开token、工具、重试和人工复核费用;不要只看官网降幅 |
| 开发者与智能体团队 | 让Sol负责复杂规划,让Luna承担批量执行;Terra放在两者之间,再比较成功率、总成本和尾部延迟 |
真正成熟的工作流,不会让所有任务都跑最强模型。复杂规划可能只占少数步骤,后续几十次检索、分类和格式转换完全可以交给Luna。反过来,客服实时回复、代码代理交互或交易风控,多等几秒就会损失用户和业务机会,Fast mode才可能值回两倍价格。
接下来该盯的也不是下一轮降价幅度,而是三项更硬的指标:Fast mode能否在真实高峰期稳定提速,Luna执行复杂子任务的失败率有多高,混用Sol和Luna后单个成功任务究竟省了多少钱。
模型看起来越来越便宜,企业真正要买的却不再只是模型。谁能决定何时调用哪一档、失败后怎么切换、速度预算花在哪里,谁才握住下一阶段的成本主动权。
