一个说“几乎一无所获”,一个说“数据不支持这个结论”。Futurism和RuntimeWire吵的是同一家公司、同一批模型,引用的还是同一个独立评测机构Artificial Analysis的数据。结论却完全相反。
这不是罗生门,是一次很典型的“各取所需”。把两边的引用摊开对齐着看,才能看出真正值得记住的东西:Meta的AI进步是真的,但进步的边界也是真的,双方都没说全。
三个月,8分
Futurism说Muse Spark“在大多数任务上被对手轻易超越”,只字未提三个月前它还是什么水平。
Artificial Analysis的数据显示,Muse Spark 1.1在智能指数上拿到51分,而三个月前的1.0版本只有43分。Humanity's Last Exam从40%涨到45%,只比Claude Opus 4.8低1分。SciCode从52%涨到58%,排到了所有已测模型的第三名,前面只有Claude Fable 5和Gemini 3.1 Pro Preview。
这是一条追赶斜率,不是一次性达标。三个月涨8分,能不能继续保持,才是接下来该盯的事,而不是这次的分数本身。
26美分一题,是怎么算出来的
Muse Spark的定价也不是空口说竞争力。按Meta官方API价格,输入token每百万1.25美元,输出token每百万4.25美元,缓存命中价0.15美元。Artificial Analysis用这套价格跑完整个智能指数测试,总花费548.07美元,混合费率0.78美元/百万token,折算下来每道题约26美分。
| 项目 | 数值 | 说明 |
|---|---|---|
| 输入token价格 | 1.25美元/百万 | Meta官方API报价 |
| 输出token价格 | 4.25美元/百万 | Meta官方API报价 |
| 缓存命中价 | 0.15美元/百万 | 降低重复调用成本 |
| 单题平均成本 | 约0.26美元 | Artificial Analysis实测折算 |
这组数字Futurism一个没提。不是它不存在,是它不利于“几乎一无所获”这个开场白。
Axios原文没说的话,被安在了它头上
Futurism写Muse Spark“在大多数任务上被轻易超越”,引用来源是Axios。可Axios那篇报道说的,其实只是agent在长程任务上运行更久、覆盖更广,一个窄得多的判断。
从“一个具体短板”变成“大多数任务”,这不是概括,是拔高。可以核实的引用失实,比一句“afterthought”的形容词判断更容易站不住脚。
双方都没细究的盲区
RuntimeWire的反驳站得住,但它自己也有没交代清楚的地方。Meta宣称Muse Image在Arena人类偏好榜上拿到文生图、单图编辑、多图编辑三个类别的第二名,这组数字来自Meta自己的发布公告,目前还没看到独立评测机构的交叉验证。用官方自证数据去打脸对手,和Futurism用形容词代替数据,本质上是同一个问题的两个方向。
agent长程任务的差距,反而是双方唯一的共识——Meta自己承认,OpenAI、Anthropic、Google的agent确实能跑得更久、干得更杂。这条真短板,没人回避,也没人真正展开讲。
- 结论.Muse Spark的追赶速度是真的,前提是这条曲线能续下去;三个月的数据不足以外推一年。
- 风险.Muse Image的“行业第二”只有Meta一家说法,agent长程能力的差距双方都承认却都没深挖,这两块才是真正没被验证的地方。
跑分能证明谁跑得快,证不了谁跑得远。
Meta今年的资本开支预计冲到1300亿到1450亿美元,自由现金流已经明显承压。一个有竞争力的模型加上30多亿日活的分发盘子,不等于这笔钱花得值。孙子讲“知彼知己,百战不殆”,这场媒体之间的数据战打到现在,双方都只“知”了对自己有利的那一半。读者真正该做的,不是选边站队,是自己去查一眼Artificial Analysis的原始榜单——那份表格,比任何一方的转述都诚实。
