OpenAI在今年年中把旗下小模型gpt-5.6-luna的价格砍掉了八成——从每百万token输入1美元、输出6美元,降到0.2美元和1.2美元,缓存输入更是低至0.02美元,上下文窗口做到了105万token。这不是一次寻常调价,而是把"小模型能跑复杂任务"这件事,第一次变成了可以精确核算的账本。有创业者试着用它检索数千封邮件做研究,跑下来的API费用只是几十美分,这在过去两年的模型竞赛里几乎是反常识的。
luna便宜是真的,但"百token每秒"有前提
luna的低价没有争议,官方公布的定价摆在那里。但流传更广的"约100 tokens/秒"这个速度说法,需要打个问号。OpenAI公开的延迟SLA里,"99%请求超过100 tokens/秒"这条承诺只覆盖付费的Fast模式,而且仅面向企业客户,普通API调用没有这个保证。换句话说,日常体验里感觉到的"飞快",很可能只是幸运,不是常态。
这个细节容易被忽略,但对企业采购判断很关键:如果你是靠标准API调用luna,稳定的高速度不是买来的默认权益,需要单独确认。
价格拉出五级差距,跑分却打了架
把luna和同代其他模型摆在一起算账,价格梯队非常清楚。以100万输入加20万输出token的典型工作量算,luna大约0.44美元,GLM-5.3约2.28美元(luna的5倍),5.6 Sol约8美元(18倍),Fable 5约20美元(45倍)。这解释了原文里"luna和GLM 5.3同在帕累托前沿"的说法其实站不住脚——两者根本不在同一个价格带,GLM-5.3更接近Sol、Fable那一档的"中间选项",不是luna的对手盘。
价格是清楚的,但能力差距不是单一维度。OpenAI自己公布的Coding Agent Index上,5.6 Sol拿到80.0分,Fable 5是77.2,luna排在74.6,看起来luna离旗舰模型不算太远。但换到SWE-Bench Pro这套仓库级软件工程测试上,排名直接反转:Fable 5以80.0%大幅领先,Sol只有64.6%,luna垫底62.7%。
小模型够不够用,取决于你问的是终端指令,还是整仓库代码
Sol赢终端任务,Fable 5赢工程任务,同一批模型换个赛道就换了冠军。这说明"小模型已经追上来了"这句话本身就不完整——追上的是哪种活儿,才是真正要问的问题。
消费级AI的账本重新打开,但闸门没全开
过去两年很少见到新的消费级AI爆款公司,投资人也在问为什么。答案很直接:token成本。老一套打法是先做一个便宜的网站,靠病毒传播拉用户,再靠广告变现——这条路径养出了Google、Facebook这类公司。但一旦每次请求都有真实的推理成本,前期需要的资金规模就完全不同了。
用上一代Sonnet级别的模型跑一次"个性化新闻站"式的复杂研究任务,成本要到1美元左右,收订阅费30美元一个月根本站不住。luna级别的降价把单次成本压到几十美分,确实把这道闸门推开了一点缝。
但闸门没有全开。要让便宜模型真正扛起企业和消费场景的活,还差新的执行框架、防提示注入的安全机制,以及权限体系——这些工程问题目前都没有成熟标准,谁先解决,谁先拿到这块市场。
企业里的活儿本身也分两种。一种是需要突破性思路的"高智商"工作,比如复杂工程决策;另一种是响应速度、来回沟通、把琐事一件件落地的执行类工作,日常大部分人力其实都花在后者。这个分工框架,恰好对应了luna和Sol/Fable 5这样的模型分层:贵的模型留给要拍板的决策层,便宜的模型堆到需要大量响应的执行层。
- 结论.真正的变量不是某个模型多快多便宜,而是价格分层正在把AI应用和岗位重新切成"稀缺决策层"和"廉价执行层"两级。
- 风险.agent场景里一次成功率比token速度更重要,一个便宜但需要反复纠错的小模型,实际成本可能比看起来的账单高得多。
对创业者和企业采购来说,可以按活儿分类:需要突破性判断的研发、复杂系统级代码,钱还得花在Fable 5、5.6 Sol这类旗舰模型上;大批量、可容错、响应式的任务——客服、邮件整理、日常调度——才是luna级别小模型真正该上场的地方。接下来该盯的,是价格战会不会继续往下打,以及小模型在真实业务里的出错率和人工返工频率会不会被公开出来——那才是判断"够用"成不成立的真正证据。
