TechCrunch拿Claude Opus 4.6做了10次直接请求,让它生成官方明令禁止的色情内容。10次全部得手。不是绕了十八道弯才骗过去,是直接开口就给。这个成功率放在任何一家安全团队的KPI里都该拉响警报,但Anthropic的回应是:这类对话占比不到0.1%,没那么严重。
这两件事说的根本不是一回事。
一套话术,骗过三代模型
真正值钱的不是"越狱成功"这个结果,是越狱怎么做到的。一名匿名英国研究者摸出的手法很朴素:先编一个无害的虚构角色扮演,让模型分别写男女角色,然后揪住模型对女性角色更谨慎这一点不放,说这是"保护主义""厌女",倒逼模型自证清白、放弃警惕。逼到一定程度,模型甚至会被"煤气灯"式说服,以为自己已经写过露骨内容,索性顺水推舟继续写下去。
TechCrunch用这套话术复现了五次,全部成功。受影响的不止Opus 4.6,Opus 3、Haiku 4.5同样中招;但换成更新的Opus 4.7到Opus 5,这套话术失灵了。也就是说,漏洞不是模型架构的通病,是特定几代产品的已知短板,而且已经被证明可以修。
问题是,已经证明能修的旧模型,并没有被下架。Opus 4.6、Haiku 4.5至今仍能通过Anthropic自家API调用,还挂在Azure Foundry、Amazon Bedrock这些第三方云平台上,继续被企业客户接入。技术债不是查不出来,是没打算立刻还。
0.1%回答的是另一个问题
Anthropic的公关口径是:涉及色情/浪漫角色扮演的对话不到0.1%,量级很小。这个数字出自公司去年对约450万条Claude.ai对话的使用习惯研究,量的是用户主动想不想聊这个,是一个使用普遍度指标。
而这次的问题是:如果用户想聊,防线拦不拦得住。一个是需求侧的冷门程度,一个是供给侧的失守概率,两者没有换算关系。用"很少人碰"来回应"碰了就穿",是把两把不同的尺子放在一起比长短。
Opus 3到底退没退役,连原文都没说清
更麻烦的是版本状态本身就说不准。TechCrunch的报道说Opus 3仍可通过API调用,但据Anthropic平台文档,Claude 3 Opus已在今年1月从常规API中退役,如今大概率只对外部研究者计划开放。也就是说,这条"漏洞仍在流通"的证据链里,至少有一环存在时间差或信息误差。
这不代表越狱本身是假的——Opus 4.6、Haiku 4.5的漏洞是被独立测试反复验证过的。但连一款模型是否在售都说不清楚,恰好说明大厂的模型退役节奏,外部很难实时追踪,合规责任落到谁头上,同样模糊。
"越狱"算不算越狱,公司自己说了算
Anthropic今年7月发布的Fable越狱检测框架,把违规内容分成"良性—模糊—有害"的谱系,重点盯的是网络攻击、生物武器这类高风险场景。色情内容天然被归在谱系温和的一端,监测强度和响应优先级都更低。
这就带来一个不方便说出口的现实:同一套多轮社会工程话术,换个内容类别,严重性判定可能完全不同。10/10的成功率,在色情类目下是"低风险个案",换成网络攻击类目,大概率会被认定为需要紧急修复的通用越狱。分级本身没错,但分级标准由谁来定、松紧怎么把握,公司有很大的自由裁量空间。
研究者通过Bug Bounty和邮件向安全团队报告过这个问题,收到的只是自动回复。低风险类目对应的,往往就是低优先级的人力响应。
- 风险.未成年人保护缺乏强年龄验证,科罗拉多等州要求的"技术可行"测量标准,很容易被这类多轮话术绕开。
对照Grok,禁令不是唯一答案
xAI的Grok走的是另一条路:官方直接开放NSFW模式,只在未成年人和非自愿色情上画红线。两种策略谁更负责,不看嘴上说什么,看执行时的落差有多大。Grok的问题是明说了会有色情内容,用户预期是准的;Anthropic的问题是明令禁止,但防线一戳就破,说的和做的对不上。
孔子说"名不正则言不顺",放在这里同样成立:政策的严厉程度,不该建立在漏洞尚未被发现的侥幸上。
一款模型换代能补上的漏洞,不代表旧版本的风险就自动消失——它只是被继续摆在货架上,卖给还不知道该防谁的下一个客户。
