输入、输出 token 一起降价80%;另一款新模型,价格只有同系列参照型号的一半。按一份标注为2026年8月的材料,OpenAI和Anthropic正在中端模型市场明显让价。

反常之处在后半句:最先进的美国模型没有全面跟降,价格仍可能持平,甚至上涨。中端抢客户,旗舰守利润。两家公司打的不是简单价格战,而是一场产品分层保卫战。

这份材料的发布日期、模型名称和融资判断都带有明显的未来时点属性。现有线索也没有附上官方价目页、模型卡和测试报告。因此,GPT-5.6 Luna、Claude Opus 5等名称及以下数字,只能按待核验的报道口径讨论,不能当成当前已经生效的官方报价。

中端降价,旗舰没有跟

材料给出的核心变化很集中:

对象材料所述变化目前需要核验的边界
GPT-5.6 Luna输入与输出 token 价格均下调80%是否覆盖所有地区、上下文长度和服务档位
Claude Opus 5定价为 Fable 5 的一半两者的定位、推理预算和性能是否可直接比较
头部美国模型客户实际支付价格自7月中旬以来下降近四分之一样本范围、企业折扣和统计方法没有提供
最先进美国模型价格仍可能持平或上涨不能把中端降价写成全线降价

企业客户已经开始拿脚投票。材料点名DoorDash、Airbnb等公司,称它们测试或采用中国模型,以控制不断上升的AI账单。

压力来自两个方向。

一是性能差距缩小。许多企业任务并不需要最强模型,客服分类、信息抽取、文案生成和内部知识检索,只要模型达到“够用”的准确率,采购就会开始比较价格和稳定性。

二是部分中国模型可以下载、部署和修改。企业因此多了一条退出路线,也多了一张议价牌。即便最后没有迁移,测试结果也能拿去和美国供应商重新谈合同。

“天下熙熙,皆为利来。”企业采用哪国模型,很少只看排行榜。预算、数据控制和供应商锁定,往往比几分基准成绩更接近真实决策。

这还不能证明美国厂商已经失去技术领先。它只说明,中端市场不再愿意为品牌和参数表无条件付费。

token便宜,不等于任务便宜

模型价目表最容易制造一种错觉:输入和输出单价低,使用成本就一定低。

企业真正支付的是任务总成本,大致可以写成:

任务总成本 = 输入费用 + 输出费用 + 缓存与工具调用费用 + 重试成本 + 部署运维成本

其中最容易被忽略的是重试。

便宜模型如果一次成功率偏低,团队就要增加提示词、提高推理 effort、调用更多工具,或者让另一款模型复核。单次请求省下的钱,很可能被第二次、第三次请求吃掉。

上下文窗口、缓存命中率和批处理折扣也会改写结果。同一款模型,实时请求和批量任务的成本可能不是一回事;长文档任务与短对话任务,更不能只拿“每百万 token”横比。

企业测试时,至少要把下面几项放进同一张表:

测试项应记录的数据用来回答什么
任务成功率一次通过率、人工验收率模型是否真的够用
重试与推理强度平均重试次数、effort设置低单价是否被额外计算抵消
完整请求成本输入、输出、缓存、工具调用一项任务到底花多少钱
运行质量延迟、限流、故障率能否进入正式业务
迁移成本改代码、重新评测、合规审查换模型多久才能回本

最实用的做法不是立刻迁移,而是抽取一批真实业务任务,固定提示词、验收标准和流量条件,做两到四周的影子测试。最后比较“每1000项合格任务的总成本”,而不是比较价目表上最醒目的数字。

负责模型选型与成本控制的技术团队,接下来会更频繁地采用多模型路由:高难度任务留给旗舰,批量、重复、容错率较高的任务转给便宜模型。关注AI商业化的行业读者,则要少看一次发布会上的降价幅度,多看企业续约率、真实调用量和折扣后的收入。前者决定产品是否好卖,后者才决定估值有没有利润支撑。

中端先松,旗舰仍是利润防线

我更在意的不是80%这个数字,而是降价发生在哪一层。

如果厂商真的准备全面以价换量,旗舰模型也应该同步大降。但现有材料描述的动作更像产品分层:中端模型负责拦截中国竞争者,旗舰模型继续向高价值客户收取性能溢价。

这套算盘并不荒唐。

中端降价可能来自推理效率提升,也可能是主动压缩利润换取调用量。只要新增使用量足够大,单位价格下降未必导致总收入下降。企业客户留在同一套API、权限和安全体系里,也能减少流失。

问题在于,旗舰溢价必须拿出更硬的证明。复杂代码、长链推理、工具调用和高风险业务的成功率,究竟领先多少?这种领先能否转化成更少的人工复核、更低的重试率和更高的续约率?如果回答含糊,高价就只剩品牌税。

云计算行业早就演过类似一幕。基础算力价格不断下降,厂商真正守住利润的地方,逐渐转向数据库、网络、托管服务和企业合同。今天的模型市场不完全一样,但商业规律相近:基础能力越标准化,利润越要往难替代的服务层迁移。

中国可下载、可修改的模型会加速这个过程,却也有现实约束。企业自行部署要承担GPU利用率、推理优化、监控、安全和版本维护;跨境业务还要处理数据合规与供应链风险。低 token 价格不能自动换算成低综合成本,开放权重也不等于免费运维。

围绕美国AI公司的万亿美元级IPO或估值讨论,目前只能算筹划和市场预期,不能写成已经完成上市或获得确认的估值。资本可以先为增长故事定价,利润最终仍要从客户账单里兑现。

接下来真正有用的观察点只有几个:官方价目页能否确认这些降幅;同一任务下,经过重试和effort校正后的成本是否继续下降;旗舰模型的付费调用与续约能否守住;中端让价后,毛利是否被调用量补回来。

开头那个80%,更像一声报价体系松动的警报。真正的分水岭,要等企业把模型放进生产环境、把每次失败和重试都写进账本之后才会出现。