Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5。按照公司的说法,新模型在多个领域“接近”Claude Fable 5,复杂编程能力明显提升,同时加强了网络安全防护。其 API 价格维持 Opus 4.8 水平:每百万 token 输入 5 美元、输出 25 美元,约为 Fable 5 的一半,也略低于 OpenAI GPT-5.6。

这次发布更像一次企业市场的重新定价。Anthropic 没有让 Opus 5 取代 Fable 5,而是把接近旗舰的能力放到更容易进入日常预算的价格带。对采购方而言,问题已经从“谁的旗舰模型最强”,变成“哪些任务仍有必要为旗舰付两倍价格”。

Anthropic 把 Opus 5 放在企业日常主力模型的位置

Opus 5 与 Fable 5 的定位仍有差别。Fable 5 面向长周期智能体、复杂推理等高难任务;Opus 5 则更强调编程和常规企业工作负载。Anthropic 所说的“接近”,目前仍是厂商表述,不能等同于独立评测已经证明全面追平。

模型公开定位输入价格输出价格当前最需要核验的变量
Claude Opus 5企业日常任务、复杂编程5 美元/百万 token25 美元/百万 token编码表现、拒答率、自动降级频率
Claude Fable 5长周期智能体等高难任务约为 Opus 5 的两倍约为 Opus 5 的两倍高难任务优势能否覆盖价差
GPT-5.6OpenAI 同档竞品略高于 Opus 5略高于 Opus 5企业开放范围与真实任务表现

价格差异放进账单会更直观。假设一个团队每月消耗 1 亿输入 token 和 2000 万输出 token,按标准费率计算,Opus 5 的模型费用约为 1000 美元。若全部启用价格翻倍的 Fast mode,费用会升至约 2000 美元。这个例子没有计入缓存、批处理、工具调用和重试成本,但足以说明:标价低一半,不代表最终账单也一定低一半。

企业开发团队不宜立即把全部工作流迁过去。更现实的做法,是先拿内部代码库、智能体任务和工具调用链做一轮并行测试。测试集应保留失败案例,并分别记录一次成功率、人工接管次数、拒答次数、降级次数和完成任务的总 token,而不只比较公开基准榜单。

安全审查正在改变模型开放节奏

Opus 5 发布前的背景,比性能数字更重要。Fable 5 和 Mythos 5 此前曾因美国政府对网络安全能力的担忧下线数周,恢复后增加了更严格的网络安全保护。Opus 5 也在接受政府合作方的独立测试。

这不等于政府已经为 Opus 5 背书,更不能写成发布前审批或认证通过。准确的理解是,前沿模型能否开放、以什么方式开放,已经不完全由厂商按产品节奏决定。安全测试正逐渐成为发布条件的一部分。

GPT-5.6提供了一个横向参照。该模型曾先向政府批准的机构限量预览约两周,再扩大开放。两家公司路径不同,却指向同一个行业现实:模型越接近高风险网络安全能力,公开发布与受控测试之间的边界就越难由厂商单方面划定。

这也解释了 Anthropic 为什么同时强调性能与防护。Opus 5 若能承接大部分编码和智能体任务,Fable 5 就可以留在更严格、更昂贵的使用层级。对 Anthropic 来说,这是产品分层;对客户来说,则意味着权限、拒答和模型回退都可能进入采购条款。

同价升级仍有两项隐藏成本

Opus 5 的限制不在价格表最醒目的位置。Fast mode 可以提高响应速度,但价格翻倍。安全机制触发拒答后,用户还可以选择自动回退到低阶模型。

自动回退能减少流程中断,却会带来能力波动。同一个工作流可能前半段由 Opus 5 处理,触发安全规则后改由低阶模型继续执行。用户看到的仍是一条完成记录,实际的代码质量、推理深度和工具调用稳定性却可能已经变化。

这对两类人影响最直接:

决策者接下来该做的动作建议设置的退出条件
企业 AI 采购方用本企业 token 结构重算标准模式、Fast mode、重试与回退后的总成本总成本没有明显低于 Fable 5 或 GPT-5.6,就暂缓扩大采购
编程与智能体团队在真实代码库中测试长任务、工具调用、拒答和降级后的结果一致性降级导致关键任务质量不稳定,保留旗舰模型或人工复核通道

目前材料没有给出足够的独立基准明细,也未完整说明上下文长度、地区可用性,以及 API 和各产品端的具体开放范围。这些信息缺口决定了 Opus 5 现阶段更适合小范围验证,不适合只凭发布稿完成大规模替换。

古人说“听其言,观其行”。Anthropic 已经给出了价格和定位,企业接下来要看的“行”,是内部任务成功率、拒答率以及一张包含回退与加速费用的完整账单。若这三项过关,Opus 5 才真正有机会从新模型变成企业主力模型。