同一款 GPT-5.6 Sol,智能水平不变,只把速度最高拉到2.5倍,OpenAI就收两倍价格。另一边,Luna直接降价80%。

这组定价比一次普通促销更有意思。OpenAI正在把模型能力拆成两门生意:大量、可等待的任务交给便宜模型;不能等的高价值场景,再为延迟单独付费。

Luna降80%,Sol标准价没涨

按OpenAI官方公告《Advancing the price-performance frontier with GPT‑5.6》,三档模型的价格变化如下。

模型或模式调整前调整后适合的任务
GPT-5.6 Luna输入1美元、输出6美元输入0.20美元、输出1.20美元分类、抽取、批量处理、高并发执行
GPT-5.6 Terra输入2.50美元、输出15美元输入2美元、输出12美元需要更高质量,但仍要控制成本的任务
GPT-5.6 Sol标准模式原价原价不变复杂规划、推理和高价值任务
Sol Fast mode标准模式的2倍价格对响应时间敏感的交互与代理流程

表中价格均按每百万输入或输出token计算。Luna降幅为80%,Terra为20%。

Fast mode取代原来的Priority Processing,模型智能水平不变,官方称速度最高可达标准模式的2.5倍。由于现有材料没有给出Sol标准模式的具体单位价格,也没有列出旧Priority Processing的完整费率,无法严谨计算新旧加速服务的价差。

所以,Sol没有普遍涨价。OpenAI只是增加了一个可选的速度档。把它概括成“最贵模型加价”,会误导采购判断。

ChatGPT Work和Codex订阅的价格、额度预算也没有变化。不过,Terra和Luna现在消耗的credits更少。同样一笔订阅预算,可以跑更多批量任务。

直接受益的是高并发API客户。文档分类、客服工单识别、代码批量改写、数据抽取,这些任务对单次延迟不太敏感,却会吞掉大量token。Luna的降价会很快反映在账单上。

Token便宜了,任务未必便宜80%

用一笔简单的月度调用量计算:1亿输入token,加2000万输出token。

模型调整前token费用调整后token费用节省
Luna220美元44美元176美元
Terra550美元440美元110美元

这是最直观的价格红利,也说明Luna为什么更适合规模化执行。调用量再放大,差额会更明显。

但采购部门不能拿“降价80%”直接乘企业AI总预算。

一个代理任务可能多次调用模型,还要处理长上下文、搜索、数据库、代码执行和其他工具费用。规划失败后重新尝试,token会继续增长。模型单价便宜了,如果工作流因此更敢消耗上下文、更频繁重试,最终账单可能只下降一部分。

OpenAI还给出两组很抢眼的官方数据:Luna的单任务成本约为一年前前沿模型的6%,速度接近其9倍;与Fable 5相比的成本优势,则来自Agents’ Last Exam测算。

这些数字只能放回对应基准里理解。包括“成本低近99%”之类的表述,都不等于所有业务能获得同样降幅。任务类型、提示词长度、成功率和评测方法一换,结果就可能变化。目前也没有独立测试足以把这些官方数字写成行业定论。

如果团队通过AWS等第三方渠道接入,还要核对实际生效时间、区域、合同价格和credits结算方式。公告价格不一定会在每条采购链路上同时落地。

智能开始商品化,延迟接过溢价

我更在意的是,OpenAI正在学习云计算行业最熟悉的一套做法。

同一类资源,按性能、时效和确定性分层收费。云服务器有按需、预留和竞价实例;电力有峰谷电价。模型市场现在也走到这一步:基础智能越来越便宜,及时交付却越来越贵。

两者不完全一样。模型输出存在随机性,复杂任务也很难像CPU时间那样准确计量。但背后的商业逻辑相通:成本下降后,不把全部效率红利交给客户,而是重新设计计价单位,把稀缺部分单独标价。

OpenAI公开强调模型、推理系统和代理框架的效率提升。现有信息不足以把降价归因于竞争压力、需求不足或财务状况。能够确认的只有一件事:它已经有能力把低价模型推向更大规模,同时保留旗舰模型的速度溢价。

“天下熙熙,皆为利来。”模型厂商不会只比谁的token更便宜。价格降到底之后,利润会转向延迟、稳定性、调度优先级和工作流锁定。

企业的采购方法也该跟着变。

相关团队接下来最现实的动作
企业AI与API成本决策者用真实调用日志重算单任务成本,拆开token、工具、重试和人工复核费用;不要只看官网降幅
开发者与智能体团队让Sol负责复杂规划,让Luna承担批量执行;Terra放在两者之间,再比较成功率、总成本和尾部延迟

真正成熟的工作流,不会让所有任务都跑最强模型。复杂规划可能只占少数步骤,后续几十次检索、分类和格式转换完全可以交给Luna。反过来,客服实时回复、代码代理交互或交易风控,多等几秒就会损失用户和业务机会,Fast mode才可能值回两倍价格。

接下来该盯的也不是下一轮降价幅度,而是三项更硬的指标:Fast mode能否在真实高峰期稳定提速,Luna执行复杂子任务的失败率有多高,混用Sol和Luna后单个成功任务究竟省了多少钱。

模型看起来越来越便宜,企业真正要买的却不再只是模型。谁能决定何时调用哪一档、失败后怎么切换、速度预算花在哪里,谁才握住下一阶段的成本主动权。