Fable上线两个多月,输出token报价来到每百万50美元,是Opus 5的两倍。但拿SWE-bench Pro一比,Fable只比Opus高1.1个百分点;换到SWE-bench Verified,Fable反而比Opus低1个百分点。同一周,智谱的GLM-5.2带着MIT开源协议冒出来,成本不到Fable的九分之一。这不是一次普通的新模型发布,是AI编程第一次正经面对"贵的不一定强多少"。
摩尔定律有效的年代,程序员不用精细优化代码,反正十八个月后新CPU会把性能翻倍抹平。Herb Sutter管这叫"免费午餐"。摩尔定律停滞后,并行化、内存局部性这些活才开始被认真对待。AI编程这两年也一样:模型越换越强、价格越换越低,谁也没必要在提示词和调用策略上较真。Fable打破了这个惯性——性能没有同步跳级,价格却先跳了。
贵了一倍,却没跑赢
把三家模型摆在一起看,账目很清楚:
| 项目 | Fable | Opus 5 | GLM-5.2 |
|---|---|---|---|
| 输入价格($/M) | 10 | 5 | 1.40 |
| 输出价格($/M) | 50 | 25 | 4.40 |
| SWE-bench Verified | 95% | 96% | — |
| SWE-bench Pro | 80.3% | 79.2% | 62.1% |
GLM-5.2在SWE-bench Pro上确实落后近18个百分点,这个差距不算小,尤其是仓库级、多步骤的复杂任务。但对大量重复性的编码工作,这个差距足够被"够用"两个字盖过去。这也是为什么开发者开始流行一种做法:用Fable或Opus跟需求"聊清楚"设计,再把执行任务扔给便宜模型。前半段花钱买判断力,后半段花钱买执行力,不再是一个模型包打天下。
需要提醒的是,几家厂商的跑分口径不完全一致,GLM官方对比表主要针对的是Opus 4.8而不是Fable或Opus 5,不同harness、不同工具链跑出来的分数本来就不能简单排大小。这些数字提供的是量级感,不是精确排名。
"降级"传闻和说明书对不上
原文里最耸动的一句话,是Fable的"动态降级"吓到了不少公司甚至国家。这个说法值得核实一下,因为它跟官方文档描述的机制不是一回事。
官方文档写得很清楚:所谓动态降级,本质是安全分类器触发的路由机制。被标记为网络安全或生化类的敏感请求,会被拒绝或转发给Opus 4.8、Opus 5这类模型处理。API层面看到的是HTTP 200状态码、stop_reason为refusal,不是模型随机变笨。这更像是一道合规闸门,不是质量彩票。
- 提醒.把安全路由渲染成"神秘降智",容易让读者误判风险来源,真正该盯的是下一条数据留存政策。
真正让机构犹豫的,是数据留存条款
Fable被列为"Covered Model",强制要求至少30天数据留存,且不提供零数据留存选项。这一条比"动态降级"更实在,也更容易理解为什么对数据主权敏感的公司、甚至政府机构会犹豫——它们过去习惯了可以选择零留存的产品线,现在旗舰模型这条路被堵上了。
这也解释了GLM-5.2的另一层吸引力:它以MIT协议开放权重,理论上可以自托管,绕开供应商锁定和强制留存这类条款。开放权重能不能真正落地成可控成本,还得看企业自己的算力和运维能力,不是拿来就能白嫖的营销词,但至少给了一个"不经过别人服务器"的选项。
Fable本身也不是随便谁都能敞开用:它只对付费Claude计划开放,Max及团队席位用户每周额度里最多一半能用在Fable上,超出后就得切到按量计费或者别的模型。这个配额设计,某种程度上已经替用户做了一部分路由决策。
路由成了手艺,免费午餐真的没了
一套更具体的分层策略正在成型:GLM-5.2处理日常重复的编码任务,Opus负责调试和代码评审,Fable只留给风险最高、需要一次做对的仓库级改动。这比"跟Fable聊设计、交给GLM干活"更细,也更接近真实工程里该有的样子。
价格不同步跳级,性能就不再是唯一变量
有一种乐观预期是,推理成本迟早会继续下降,最后大家还是会把所有活都丢给最大的模型。这个预期不是没有道理,但它忽略了一件事:价格下降不是Fable一家独享的红利,GLM、Kimi K3、Qwen这些模型会同步降价,harness和上下文工程也在同步进步,让小模型拿到足够好的上下文就能顶上大模型的活。便宜模型追平的速度,未必比旗舰模型跑赢的速度慢。
天下熙熙,皆为利来。这轮多模型路由不是道德选择,是成本算出来的结果。Fable证明了旗舰模型可以更贵,却没证明它必须更贵才配叫旗舰。免费午餐结束之后,谁会精算、谁会偷懒,过几个月账单自己会说话。
