OpenAI 把 GPT-5.6 Terra 的价格下调了 20%,Luna 更直接,降了 80%。

反常点也摆在明面上:OpenAI 同期披露,GPT-5.6 Sol 参与优化推理系统,让端到端服务成本下降 20%。成本降两成,价格降八成。两组数字不能直接相减,更不能据此断言 OpenAI 补贴了“剩下的六成”,但它至少说明一件事:Luna 的新价格不只是一张技术成绩单,也是一张竞争报价单。

Luna 的新价格,便宜在哪要分开算

Luna 降价后,输入价格为每百万 tokens 0.20 美元,输出价格为 1.20 美元。按 80% 的降幅反推,调整前约为 1 美元和 6 美元。

和两个低价模型横向比较,结果并非“Luna 全面最便宜”。

模型输入价格/百万 tokens输出价格/百万 tokens价格特征
GPT-5.6 Luna0.20 美元1.20 美元输出价格较低
Gemini 3.1 Flash-Lite0.025 美元1.50 美元输入价格明显更低
Claude Haiku 4.51 美元5 美元输入、输出均高于 Luna

Luna 的输入价格是 Gemini 3.1 Flash-Lite 的 8 倍,输出则便宜 20%。所以谁更省钱,取决于应用吞进去多少内容,又吐出多少内容。

只按这组公开单价计算,不考虑缓存、批处理优惠及其他计费差异:

示例工作负载LunaGemini 3.1 Flash-Lite单看 token 价格
1000 万输入 + 100 万输出3.20 美元1.75 美元Gemini 更低
100 万输入 + 1000 万输出12.20 美元15.025 美元Luna 更低

两者的价格临界点约为输入与输出 tokens 之比 1.71。输入量高于这个比例时,Gemini 更便宜;输出占比更高时,Luna 开始占优。

这会直接影响两类开发者。做 RAG、长文档检索和批量抽取的团队,通常输入多、输出短,不能只看 Luna 的八成降幅。代码代理、内容生成等输出较长的应用,Luna 的新报价更有吸引力。

至于 Claude Haiku 4.5,Luna 的输入价格约为其五分之一,输出约为四分之一。价格差距足够大,但模型质量、工具调用、延迟和稳定性仍要重新测试,不能拿单价代替完整采购判断。

Simon Willison 已把 agent.datasette.io 从 Gemini 3.1 Flash-Lite 切换到 Luna。这个案例能说明开发者对推理价格很敏感,却不能证明市场已经集体转向。

Sol 降低了成本,但没有解释完整账本

OpenAI 在技术说明中称,GPT-5.6 Sol 被用于优化负载均衡,也参与了模型前向传播的提效。

推理系统的浪费并不只来自算得慢。频繁搬运内存、等待同步、低效的数据布局,都会让昂贵的 GPU 闲着。Sol 配合 Codex,改写并优化了 Triton、Gluon 的生产内核,把部分计算提前处理、跳过或并行执行。OpenAI 称,这些工作连同更广泛的内核改进,让端到端服务成本下降 20%。

这项成果很实在。模型开始参与优化承载自己的基础设施,等于让软件继续挤压硬件利用率。过去云计算靠调度、虚拟化和规模采购压低单位成本,现在 AI 又多了一层:让模型自己找内核和数据流里的浪费。

但边界也要划清。

20% 是 OpenAI 公布的整体服务成本降幅,并非经过独立验证的 Luna 单模型成本数据。Luna 的具体推理成本、原有毛利、调用规模和硬件摊销都没有披露。它和 Terra 也未必拥有相同的成本结构。

因此,80% 降价不能简单归功于 Sol,也不能机械地拆成“20% 技术降本加 60% 补贴”。目前能确认的只有前一部分。剩余空间可能来自原有利润、规模效应、交叉补贴或主动压价,材料没有给出比例。

这恰恰是整件事最有意思的地方:OpenAI 展示了技术如何托住降价,却没有证明技术决定了全部降幅。

低价模型开始争预算,也争开发者默认选项

我更倾向于把 Luna 看成一次带有进攻性的定价。

低价模型承担的工作往往不耀眼,却调用频繁:分类、抽取、路由、简单代码修改,以及 Agent 流程中的大量中间步骤。单次请求只省几厘钱,看起来不多;当一个任务连续触发几十次模型调用,价格就会改变产品能否开放给更多用户。

这类市场很像早期云计算的价格战,但并不完全一样。云厂商降价,是用规模和资本把计算变成标准商品;模型还多了能力差异、输出稳定性和迁移成本。接口兼容不等于可以无痛换模型,提示词、评测集、工具调用和容错逻辑都可能重做。

低价仍然有强大的惯性。开发者会先在边缘任务上试用,再把更多调用迁过去。一旦模型进入默认路由、评测流程和预算表,平台拿到的就不只是当月收入,还有后续产品选择权。

“天下熙熙,皆为利来。”这次重复的正是平台竞争里那套旧逻辑:先把单位价格压到对手难受的位置,再用调用规模争取成本优势和开发者黏性。

如果你正在控制 Agent 或 AI 应用的推理预算,最现实的动作不是立刻全量迁移,而是拿自己的输入输出比例做一轮账单回放,再测试质量、延迟和失败率。价格表只能筛选候选模型,生产流量才会给出答案。

接下来最该观察的也很具体:Luna 的低价能维持多久,竞争对手是否跟进,以及 OpenAI 会不会披露更细的缓存、批处理和实际推理成本。若低价长期成立,Luna 会成为规模武器;若只是阶段性报价,这笔迁移成本最终仍由开发者承担。