同一款新模型,一边冲到榜单第一,一边画鹈鹕时漏掉了自行车轮。
Anthropic 刚刚发布 Claude Opus 5。它目前在 Artificial Analysis 榜单暂列第一,排在 Fable 5 前面;但原始评论作者尚未完成系统实测,简单绘图也出现过首轮缺件、第二轮才改善的情况。榜首是真的,稳定性仍待验证。
榜首、同价,以及一次少了轮子的输出
Opus 5 的公开信息可以压缩成四项:
| 观察项 | 已知事实 | 目前不能下的结论 |
|---|---|---|
| 性能 | Artificial Analysis 榜单暂列第一,领先 Fable 5 | 不能据此认定所有真实任务都更强 |
| 价格 | 基础价格与 Opus 4.8 相同;快速模式为基础模式的两倍 | 不能把快速模式也算成“同价升级” |
| 厂商定位 | Anthropic 称其接近 Fable 5 的前沿智能,价格约为后者一半 | 这是厂商比较口径,仍需结合任务和总调用成本 |
| 输出稳定性 | 鹈鹕绘图首轮缺少自行车轮,第二轮改善 | 榜单领先不代表一次生成就可靠 |
目前公开材料没有补齐榜单具体分数、不同任务的速度差异、稳定性分布等信息。上下文窗口和真实工程成本也不能只靠这份发布材料判断。
Anthropic 还发布了 Opus 5 提示词指南。这至少说明一件事:模型能力上涨,并没有让提示设计和任务约束自动消失。模型越主动,边界反而要写得越清楚。
开发团队真正要算的也不是单次 API 标价,而是完整任务成本:调用次数、工具执行时间、失败重试、人工复核,以及快速模式是否真的缩短了关键路径。价格表只管入口,账单往往结在流程里。
FreeCAD 个案把产品分水岭露了出来
发布材料里最有信息量的案例,不是排行榜。
在一项 Frontier-Bench 任务中,Opus 5 拿到一张机器零件图,需要编写代码,把零件重建成 FreeCAD 三维模型。测试环境却故意没有给它直接查看图像的方式。
模型没有停在“缺少视觉工具”。它自行编写了一套计算机视觉管线,从原始像素提取几何信息,再完成零件重建。
这个个案尚不足以证明 Opus 5 已经拥有稳定的通用代理能力。单次成功无法回答几个关键问题:换一张图还能不能做,失败后能否正确回退,额外代码花了多少时间,生成的视觉管线是否安全。
但它已经露出一条清楚的产品路线:模型开始把“环境缺什么”也当成任务的一部分。
荀子说“君子生非异也,善假于物也”。放到这里,关键不在模型凭空多懂了多少,而在它会不会自己找路、造工具、接着干。工程价值也由此变化。
过去,开发者要先把图像解析、文件转换、代码执行和 CAD 环境接好,再让模型完成中间步骤。若 Opus 5 能稳定补齐部分工具链,小团队会少写不少胶水代码,原型速度也会更快。
代价同样具体。一个只会回答问题的模型,出错通常停在文本里;一个会写管线、运行代码、读取文件和调用外部服务的模型,错误会进入系统。
如果你负责 AI 应用开发,接下来最现实的变化不是立即迁移全部工作负载,而是挑选两类任务做对照测试:
- 适合放开的任务.沙箱内代码生成、格式转换、临时数据处理,可重跑,也容易验收。
- 必须卡审批的任务.读取生产数据、访问密钥、修改云资源、发送外部请求,以及任何不可逆操作。
真正该测的是任务完成率、重试次数和人工接管率。只看基准分数,很容易高估节省下来的工程成本,低估模型绕路时制造的新成本。
不教攻击,守不住全部能力外溢
网络安全部分更敏感。
Anthropic 称,公司没有针对网络攻击任务训练 Opus 5。模型的漏洞发现能力仍明显提升,已经接近 Mythos 5;漏洞利用能力则明显落后于 Mythos 5。
这组差异有意义。发现漏洞和完成利用并非同一个任务。后者往往需要环境适配、利用链构造、权限维持与规避检测,专项训练可能拉开很大差距。
可“不教攻击”不能被翻译成“不会攻击”。通用代码能力、工具调用能力和自主排障能力上涨后,本来就会向安全任务外溢。发布材料只能说明 Opus 5 当前在漏洞利用评测上落后,不能证明风险已经消除。
浏览器的发展史提供了一个不完全相同、但很有用的参照。浏览器从文档阅读器变成应用运行平台后,行业不能再只靠网页作者自律,于是逐步加入同源策略、沙箱和权限控制。能力进入执行环境,治理就得进入系统设计。
企业接入 Opus 5,也该按这个逻辑处理:
| 控制位置 | 更稳妥的动作 |
|---|---|
| 权限 | 默认最小权限,任务需要时临时授予 |
| 运行环境 | 代码放进隔离沙箱,限制文件系统和网络出口 |
| 高风险操作 | 删除数据、调用生产系统、发送外部内容前人工审批 |
| 凭证 | 不把长期密钥直接暴露给模型,使用短期令牌 |
| 审计 | 保存提示、工具调用、参数、返回结果和审批记录 |
| 异常处理 | 设置调用上限、超时和熔断,避免模型持续自行绕路 |
我更在意的,是 Anthropic 能否证明这种主动性可以被稳定约束。模型偶尔会补写工具,只算一次漂亮演示;模型知道何时补工具、何时停手、何时请求授权,才算成熟产品。
Opus 5 暂时赢了排行榜。企业是否愿意把生产权限交给它,要看另一张表:越权率、失败回退、审计完整度,以及总任务成本。那张表现在还没有。
