Writer这次发布拿出了一个漂亮数字:降本50%。翻开它自己公布的定价表,故事没那么简单——Palmyra X6的token单价,比上一代X5还贵。真正把成本打下来的,不是模型本身,是模型外面那层调度代码。这中间的落差,才是这次发布真正值得看的地方。
发生了什么
Writer于8月13日发布新旗舰模型Palmyra X6,同时升级了配套的agentic harness——负责工具调用、上下文管理的编排层。官方说法:两者叠加,能把单个任务的执行成本降低52%,速度提升48%,质量提升10%。即日起向所有客户开放,新模型可以和其他厂商模型(通过Azure、Bedrock接入)混用,不强制切换。
CEO May Habib配了一句挺冲的表态:企业已经受够追逐跑分了,大厂"不懂怎么帮企业从AI里赚到钱",而且有动机让token消耗越涨越高。
"降本50%"背后,单价其实涨了
| 项目 | 旧值 | 新值 | 变化 |
|---|---|---|---|
| 输入单价(每百万token) | $0.60 | $2 | 上涨约2.3倍 |
| 输出单价(每百万token) | $6 | $8 | 上涨约33% |
| 单任务平均成本(harness升级后) | $0.25 | $0.12 | 下降52% |
对照上一代X5的历史价格,X6的单价不是降了,是涨了。那52%降本从哪来?Writer的口径是"单任务综合成本",不是token报价单。同样一个token现在更贵,但harness让模型少走弯路、少重试、少输出冗余内容,总账反而更低。
这个区分很重要。只看定价表,会觉得X6更贵;只看公关稿,又会觉得处处都便宜了。真实情况是两件事同时发生,谁也没取代谁。
harness才是真正的降本引擎
Writer自己的研究更能说明问题。他们在六个不同模型上做了同一个测试——不换模型,只优化harness本身:加提示缓存,增量压缩上下文,把部分工作丢给子agent处理,限制无意义的重试。
结果是:平均节省40%以上,区间在33%到61%之间,单位成本能拿到的质量反而提升了82%。这六个模型里包括Claude Sonnet 4.6、Gemini系列、Qwen,也包括Writer自己的GLM底座和Palmyra X6——降本效果和用哪家模型关系不大,换谁都能省。
这也是Writer论文里那句话的意思:harness是唯一一个能在你用的每一个模型上反复起作用的组件。模型会换,harness的优化一直有效。如果属实,这比"我们的模型更便宜"是更狠的竞争论点——它绕开了模型军备竞赛,直接在企业最在意的账单上做文章。
两个说不清楚的地方
一是底座版本。TechCrunch原文说Palmyra X6是在Z.ai开源模型GLM-5.2上做post-training,但Writer官方资料里出现的版本号是GLM 5.1,没有任何官方页面明确写出X6具体基于哪个版本调出来的。企业客户要评估这个模型的能力上限和安全边界,底座版本号是最基础的信息,连这个都对不上,只能说沟通不够严谨。
二是评测方法。Writer公布的九维度企业能力评测(检索、工具调用、品牌语气等),测的是"Palmyra X6跑在WRITER Agent里"的综合表现,不是裸模型对裸模型。它说自己在六模型对比里拿到最高分、价格还最低——这个结论成立的前提,是别人跑的是裸模型,自己跑的是模型加自研harness。这种比法对Writer当然有利,但离行业惯常的独立基准测试有距离,第三方复现之前,这个"第一"先打个问号。
我的判断
Habib说企业已经放弃大厂、CIO们在集体倒戈,这话听着爽,但原文没有任何独立数据或客户名字撑腰。这类话术每次模型价格战打响都会有人说一遍,信一半,剩一半留给第三方去验证。
- 结论.harness优化是真降本,已经在六个不同模型上验证过,这个判断可以信。
- 风险.把"任务成本下降"读成"token更便宜"、把"自家harness加持后的分数"当成"裸模型实力",这两步跳跃才是最容易让人踩坑的地方。
省下的是账单,不是token,这笔账Writer算得很清楚,读者未必。
Writer这套打法——不卷参数卷总成本,不卖模型卖工程——如果真能复制到别的团队身上,harness优化很可能会变成下一个企业AI厂商都要抢的赛道。但在那之前,先把"降本50%"这四个字拆开看,比信CEO一句话更划算。
