Boris Cherny在推特上聊Claude Opus 5,没把力气花在跑分上。他说,比任何一项评测分数更让他兴奋的,是Opus 5变成了Anthropic目前为止最难被提示注入成功的模型。这句话被放在系统卡第73页,不是发布通稿的大标题。
提示注入不是新鲜话题,但把"抗注入能力"当成一款新模型最大的看点来讲,这还是头一回。这句话如果站得住,决定的不是Opus 5考试考多高,而是它敢不敢被塞进邮箱、网页、代码库这些真家伙里,替人自主干活。
发生了什么:证据都在哪
| 信息点 | 内容 |
|---|---|
| 表态人 | Boris Cherny,Anthropic |
| 出处 | 推特 + Opus 5系统卡第73页 |
| 测试类型 | 内部PI(提示注入)评测 + 红队测试 |
| 原话用词 | "very hard to prompt inject successfully"——很难,不是不能 |
| 呈现位置 | 系统卡内页,不是发布通稿标题 |
这句话的边界要划清楚。"很难"不等于"不能",内部评测和红队也不等于外部长期实战验证。系统卡这一段没有公开具体的攻击成功率、测试样本规模或防线细节,Cherny给出的是Anthropic自己的判断,不是独立第三方的复测结果。
提示注入的原理不复杂:攻击者把指令藏进模型要读的网页、邮件、代码或文档里,模型分不清这是内容还是命令,跟着执行了。这是所有会自动读取外部不可信数据的Agent系统躲不开的坑。
谁该认真看,该做什么
普通聊天场景基本用不着操心这个。提示注入顶多让模型说几句怪话,伤不了大局。真正利害攸关的是两类人。
做Agent产品的开发者,这句话给了一个理由,把自动执行的权限边界往前测一测——比如允许Agent自己点开邮件里的链接,或按网页内容的建议跑一段脚本。但系统卡没公开攻击成功率和测试样本规模,开发者上线前仍需要拿真实的注入样本自己跑一轮红队,不能只凭这句表态就直接放权。
负责企业AI安全和部署决策的人,这句话可以当加分项,不该当唯一依据。更稳妥的做法是要求Anthropic或渠道方提供更细的测试条件——测试集多大、覆盖哪些攻击手法、失败案例长什么样——再决定给Agent开只读权限还是执行权限。
锐评:内部测试和真实世界之间还差一道题
系统卡第73页给出的,是Anthropic自己关起门来打自己的结果。红队再严格,测试者大概率也带着Anthropic自己的防御思路,知道这套系统哪里该防、哪里的坑最深。天下熙熙,皆为利来,没有一家模型公司会在自己的系统卡里写"我们防不住"。
外部独立研究者还没拿到机会,用完全不知道防御逻辑的野路子去试Opus 5。安全宣称和安全事实之间,从来隔着"有没有人真的来砸"这一步。
接下来最该盯的,不是Opus 5这次考了多少分,是有没有独立安全研究者拿到手实测,以及第一次有人成功注入时,Anthropic会不会像现在这样大方地把它写进系统卡里。
