Meta给新出的编码模型标了两个价,差价接近十倍。便宜的那档,输入token只要标准价的十二分之一,条件是你的代码和对话记录要被拿去训练下一代模型。这不是慈善折扣,是一笔明码标价的数据交易——而这恰恰是Muse Spark 1.3这次发布里,比跑分更值得看清楚的部分。

Muse Spark 1.3 是 Meta 面向 agentic coding(自主编码代理)场景的新模型,支持 1M 上下文窗口,能吃视频、图片、文档,主打“长链路任务里少绕路、少浪费token”。它通过 Muse Code、Meta Model API 和 OpenRouter 分发,官方话术是“在多项coding evals上可与前沿模型竞争”。

跑分自己说了什么

Meta 自报的一组数据里,Terminal-Bench 2.1 拿到 88.8 分,和 GPT-5.6 打平。但放在同一批对比材料里,GDPVal-AA v2、DeepSearchQA、Agentic IF Index 三项都落后于被拿来对标的领先模型。

“与前沿模型竞争”这句话,严格说只对了一部分。持平不等于领先,这个区别在营销文案里被悄悄抹掉了。

自家跑分,挑几项看 Terminal-Bench 2.1 88.8 与GPT-5.6打平 DeepSearchQA 89.4 MRCR 256K-512K 98.5 DeepSWE v1.1 75.4 AutomationBench 49.4 数值为Meta自报,未见第三方独立复现

比 1.2 版本进步的部分更实在:Meta 说工具调用次数少了两成,消耗的 token 少了四分之一。如果这个统计口径站得住,对天天跑长链路agent任务的开发者来说,是实打实的成本下降——比一堆跑分数字更值钱。

定价里的交易

两档价格,本质是两种客户画像。

两档定价,两笔交易 Contributor 档 输入 $0.10/M 缓存 $0.002/M 输出 $0.20/M 数据用于改进模型 约为标准价的1/12 标准档 输入 $1.25/M 缓存 $0.15/M 输出 $4.25/M 数据不进训练 与1.2版本价格一致

便宜的那一档,代价不是钱,是代码。开发者用它调试的项目、企业上传的文档、agent 跑过的每一次工具调用,都可能进入下一次训练。这套“折扣换数据”的玩法不是 Meta 独创,但放在编码场景里格外敏感——代码里往往藏着商业逻辑、内部接口、未公开的产品细节。

  • 风险.选 Contributor 档的开发者和企业,等于用九折价格,把代码使用条款的解释权交给了平台。

Llama开着门,Muse关着门

Meta 在 AI 上一直是两条腿走路。Llama 系列开放权重,靠生态和口碑换影响力;Muse 系列这次选的是闭源 API,直接对标 OpenAI、Anthropic 在编码代理赛道的产品,靠订阅和数据双线变现。

Meta的两条腿 Llama 系列 开放权重 · 生态优先 · 换的是影响力 Muse 系列 闭源API · 收费+数据 · 换的是营收

官方说开放权重版本“后续推出”,但没给时间表。放在 Llama 一贯的开放叙事旁边看,这句话更像是留个口子,不是承诺。编码代理正好是当下 AI 里估值最高、竞争最激烈的场景,Meta 选择在这里先关门收钱,再看情况开门,这个顺序本身就是态度。

开放是姿态,闭源才是账本。

还有两处细节暴露了发布节奏的仓促。OpenRouter 上对应的入口目前指向的仍是 1.2 版本,1.3 还没同步到这个主流分发渠道。所有跑分都来自 Meta 一方自报,截至目前没看到第三方独立复现的结果。

  • 结论.判断一个编码模型值不值得换,别只看跑分表,先看它在你真实项目里的工具调用次数和token消耗有没有真的降下来——这才是 Meta 自己给出的、可以验证的那个承诺。

对already在用 Muse Code 或 Meta Model API 的开发者,升级到1.3大概率是划算的,效率提升的说法目前看起来是这次发布里最实的部分。对还在纠结选哪一档定价的团队,先把代码使用条款读完,再决定要不要为了九折,把项目细节交出去。