达到同一个考试分数的成本正在断崖式下跌,但跑一次最新模型反而越来越贵。

研究机构 Epoch AI 在报告里给出了一个打破历史纪录的数字:自2023年以来,在特定测试集上达到固定准确率的成本平均每季度下降约47%,换算成年化降幅接近13倍。没有任何一项前沿技术的贬值速度能与之相比。以博士级科学测试 GPQA Diamond 达到 75% 准确率为基准,2025年初跑一次 OpenAI o3 大约需要30美分;仅过了18个月,GPT-5.6 系列里的 Luna 跑出同样分数只需0.04美分,直接跌到原价的七百二十五分之一。

昨天的技术天花板在迅速白菜化,今天的探路者却成了奢侈品。
GPQA Diamond 75% 准确率解题成本对照 2025年初 / OpenAI o3 $0.30 单题成本基准 18个月后 / GPT-5.6 (Luna) $0.0004 降至 1/725

降幅十三倍的表象与算法底色

这种断崖式暴跌很容易让人误以为通用人工智能已经彻底变成廉价公共品。如果把硬件迭代和商业补贴剥离干净,技术本身的演进速度其实并没有宣传的那么夸张。

旧款算力单元打折甩卖,最新顶尖推理节点开销暴增
旧款算力单元打折甩卖,最新顶尖推理节点开销暴增

MIT 团队近期在 arXiv 发表的追踪研究指出了另一重真相。该研究涵盖了从2024年4月到2025年11月的大量模型调用数据,测算出的质量调整后推断成本年降幅在5倍至10倍之间。更关键的是归因分解:芯片等硬件效能每年改善约30%,云服务商和开源生态的价格战又压缩了大批利润率。当把这两者剥除后,纯粹来自模型架构优化与算法训练的效率提升,年均大约只有3倍。

Artificial Analysis 的产业跟踪呈现出类似的剪刀差:达到早期 GPT-4 同等智力水平的推断成本,在发布以来的时间里缩水了超过1000倍;自2024年秋季起的一年多内,高智力模型的推断单价也下降了约32倍。

买到去年顶尖能力的门槛确实烂大街了。可如果你要运行当下最强的前沿模型去啃硬骨头,根据 MIT 的测算,单次推断的实际成本不仅没有下降,反而年均增加了3倍到18倍。

天下熙熙,皆逐其廉。然而算力账单从来不会凭空消失。

推断成本年化降幅的三重驱动力拆解 硬件性价比迭代 约 30% / 年 (半导体红利) 开源冲击与平台价格战 压缩毛利率补贴推断 纯算法与架构创新 约 3x / 年 (真实核心提效)

标牌价格与隐藏的测试时算力

标价上的百万 Token 几美分,是推理模型时代最容易迷惑决策者的数字陷阱。

为答对难题而暗中增加的推理计算让总成本彻底失控(示意图)
为答对难题而暗中增加的推理计算让总成本彻底失控(示意图)

如今以 OpenAI o3 或后续前沿版本为代表的模型,其技术路线已经全面转向测试时算力(Test-Time Compute)。模型为了答对一道高难度科学、数学或编程题目,会在给出最终答案前在内部疯狂吐出海量的思考 Token、自我纠错分支与验证调用。

单价虽然变便宜了,题目变难时消耗的算力体量却呈指数级拉升。

评估维度传统标牌视角 (Token Price)真实任务经济学 (Cost per Task)架构决策影响
计费单元输入与输出的显式字符隐式思考串 + 验证采样预算不可预测
性能取向单次直出命中率多分支反复重试收敛计费放大数倍至数十倍
核心瓶颈标牌价格每百万字几分端到端耗时与验证惩罚倒逼模型分层混用

即便最近几天 OpenAI 发布了价格再次砍半的 GPT-6 Sol 与 Luna 等小模型,它们主要是在低算力消耗区间争夺存量市场。在 GPQA Diamond、OTIS Mock AIME 或 FrontierMath 这类高门槛题库中,想要维持极高准确率,系统开销依然是由隐式算力堆出来的。

  • 风险.如果某项复杂业务每提升1%的准确率需要额外追加数十倍的验证算力,标牌单价下降根本无法阻止端到端推理总账单的膨胀。

跑分刷榜与企业生产力落差

除了测试时算力的膨胀,另一个隐蔽的变量在于测试集本身。

完全保密的测试集无法被针对性刷榜,降价幅度立刻放缓(示意图)
完全保密的测试集无法被针对性刷榜,降价幅度立刻放缓(示意图)

在 Epoch AI 跟踪的基准中,FrontierMath 每季度降本约53%,GPQA Diamond 降幅约47%。唯独一个代号 Mystery Game Puzzles 的测试集,季度降本速度只有43%,在所有样本中垫底。这个测试基于一款未公开的谜题游戏设计。当测试集完全保密、厂商无法针对性清洗数据或做定向微调时,模型的成本下降曲线立刻放缓。这就是业内常说的基准刷榜(benchmaxxing)。

纸面解题成本崩塌,到了真实业务环境里往往转化成复杂的摩擦损耗。

两份极具代表性的实证研究直接戳破了降本转化为生产力的理所当然:NBER 针对大型呼叫中心客服的研究显示,接入生成式模型后员工平均生产力只提升了约14%,高水平员工几乎未能受益;而在 METR 针对资深开源程序员的246项具体任务测试中,受测者主观感觉工作变快了,实际完成任务的总耗时却反倒增加了约19%。

生成内容变得几乎不要钱,但人类阅读、求证、审查与修复暗坑的认知带宽,从始至终都是一条昂贵的水平线。

  • 结论.技术选型的关键指标正在从单纯的输入输出单价,转向单次有效任务成本;盲目追捧前沿模型往往带来算力与审校的双重浪费,根据业务容错度将腰部轻量模型与按需重度推理结合才是可持续的解法。