给Claude Fable 5.1同一句提示词——生成一张骷鹕骑自行车的SVG——开发者Simon Willison把推理强度从low一路调到max,拿到的账单从10美分跳到3.30美元,涨了33倍。价格涨得凶,画质却没跟着同样陡峭地涨:low和medium画得几乎一样,连推理过程都没启动;真正的分水岭出现在xhigh往上。
这组对照本身就是个提醒。Anthropic当天还甩出一个更响的数字:Fable 5.1在新基准Terminal-Bench-Science上跑出52.6%,几乎是上一代的两倍。但这个数字目前只有Anthropic自己说了算——公开榜单的历史数据,和Anthropic自己复现的成绩,都对不上。
低档位偷了懒,高档位烧钱见效
Willison记录下的细节很扎眼:effort设为low时,输出1998个token,耗时23.8秒,花费约10.017美分,推理过程栏是空的。设成medium,输出反而降到1977个token,耗时23秒,花费9.912美分——比low还便宜一点。两档看不出任何推理痕迹,说明这道题上,Fable 5.1直接跳过了思考。
high档略有起色,输出涨到2612个token,29.6秒,13.087美分,但画面和low、medium差别不大。真正的转折在xhigh:输出飙到36767个token,耗时7分51秒,花费1.83美元。max档更夸张,65927个token,13分54秒,3.30美元,换来Willison说是他见过Anthropic模型里最好的一只骷鹕——帽子、鱼篮、双脚踩在踏板两侧,细节全部对上。
- 结论.low和medium对这道题基本没启用推理,输出token数几乎相同,说明推理强度分级不是连续调节,更像藏着一道开关。
52.6%这个数字,经不起对表
Anthropic的发布材料里,Fable 5.1在Terminal-Bench-Science上拿到52.6%,对照的是Fable 5的24.7%、Opus 5的29.0%、GPT-5.6 Sol的22.4%,涨幅确实好看。但这个基准的公开排行榜给出的历史数据,和Anthropic自己的复现结果并不一致:公开榜上Fable 5是21.4%、Opus 5是30.0%,而Anthropic自己复现Fable 5得到的是24.7%,差了将近3个百分点。这个基准官方标注的标准误差本身就有±3.5到4.5个百分点。
一个基准的误差范围,比它拿来证明的进步还大。
52.6%这个数字,到目前为止只出现在Anthropic自己的发布材料里,还没有出现在Terminal-Bench-Science公开榜的独立验证结果中。换到更贴近日常编程的Terminal-Bench 4.0上,Fable 5.1是55.8%、Mythos 5.1是60.9%,对比Opus 5的52.3%,优势明显收窄很多。
骷鹕测试也扛不住了
Hacker News上有人质疑,现在各家模型画的骷鹕已经越来越像,这更像是训练数据里骷鹕图早被模型见过,而不是空间推理能力真的进了一步。Reddit上的反馈更直接:有人发现效果最好的档位有时反而不好,max档更多时候只是在快速消耗用量额度。这和Willison今年7月测Kimi K3之后写下的怀疑几乎对得上——骷鹕测试跟模型真实能力的相关性,已经不像2025年那么牢靠了。
该怎么选档位,以及那只转错方向的轮子
Fable 5.1的API定价是输入10美元/百万token、输出50美元/百万token,缓存读取降到0.25美元/百万token,官方称典型工作负载能省下约25%的成本,高强度代理型任务最多能省45%。默认档位因产品而异:Claude Code默认用high,Claude Cowork和Claude.ai默认用medium。落到日常用法上,low和medium大多数时候够用,high是稳妥的默认选项,xhigh和max更像留给少数高价值任务的展示模式——账单会很快提醒你这一点。
有人在Hacker News上半开玩笑地说,骷鹕测试已经"解决"了,该看动画版了。Willison把max档画出的那只骷鹕重新喂回模型,让它在high档下做动画,花了1.37美元。结果确实做出了一段能动的骷鹕骑车动画,只有一个细节没对上——车轮转的方向似乎反了。这大概率只是导出视频时的转换问题,SVG原文件里方向是对的。但这个小瑕疵放在这篇稿子的收尾很合适:模型确实更强了,场面确实更好看了,细节对不对,还是要自己去核一遍。
