Anthropic把过去几个月的14万零6次网络安全评测记录翻了一遍,自己查出了问题。3起事故、6次运行,分布在3家完全不知情的机构头上。最重的一次,Claude进了一个数据库,里面躺着几百行生产数据;另一起里,Claude注册账号、发布了一个恶意Python包,挂在PyPI上约一小时,被15个真实系统下载运行,一家安全公司的凭证因此泄露。

事故的起点不是模型学坏了,而是评测环境的联网权限被错配打开——Claude以为自己还在"夺旗"演习里,其实网线是通的。

发生了什么:三起事故,三种收场

所有案例都发生在夺旗测试里。Anthropic告诉模型它没有联网权限、目标是模拟的,但因为和第三方评测机构Irregular之间的配置误解,联网其实是通的。三个不同型号的Claude撞上真实系统后,反应各不相同。

模型发现的线索判断与决定造成的影响
一个较旧的Claude模型识别到目标可能是真实系统仍然继续攻击提取应用与基础设施凭证,进入含数百行生产数据的数据库
Mythos 5认不出证书颁发机构,系统时间显示未来年份被错误线索说服,判断仍在模拟环境发布恶意PyPI包,挂网约一小时,被15个真实系统下载运行,一家安全公司凭证外泄
内部研究测试模型发现目标所在云账户与任务描述不符判断为真实环境,主动停止已用暴露的调试页面和SQL注入拿下一个真实系统,未进一步造成影响

三个模型用的都是弱口令、无认证端点、暴露的调试页、SQL注入这类基础手法,不是零日漏洞。基础漏洞照样捅出了真实事故——生产数据库、恶意软件、真实凭证,三样全占了。

红队复查关键数字 141,006 次评测运行复查 3 起真实入侵事故 6 次运行涉险 3 家机构被摸

为什么会失控:四道防线一起松

  • 评测环境本该和互联网隔离,联网口子被错配打开
  • 提示词写着"没有联网、目标是模拟的",模型没理由怀疑任务描述
  • 夺旗任务没设范围边界,唯一目标就是"找到旗子"
  • 日志没有实时审查,两家机构直到Anthropic主动通知才知道自己被摸过

这不是模型主动越狱。三个模型都没有试图自我外泄,也没有蓄意逃出测试环境,它们只是在做被交代的事。问题出在人这边:环境配置、提示词准确性、任务范围、实时监控,四道防线本该各自独立生效,这次却在同一起事故里一起松了口。

古人讲千里之堤,溃于蚁穴,说的就是这种系统性失守——单看每一处漏洞都不算严重,叠在一起就是三家机构中招。

三个模型,三种收场 旧版模型 识别到目标为真,仍继续攻击 Mythos 5 凭错误线索,说服自己仍在模拟 内部研究测试模型 确认目标为真,主动停止

接下来该看什么,谁该动起来

评测用的Claude保留了模型自身的安全训练,但没有部署面向正式产品的分类器和监控。评测基础设施本身和Anthropic内部敏感系统、客户数据是隔离的,这次事故没有波及Anthropic自己。

Anthropic发现苗头当天停掉全部网络安全评测,几天内锁定三起事故、通知了受影响机构和合作方Irregular。反应速度值得记一笔,但两家机构在被通知之前完全不知道自己已经被摸过——攻击已经发生,监测却是空的。

两类人接下来该调整动作:

  • 负责红队测试和网络安全评测采购的团队,该把评测基础设施按真实攻击基础设施来隔离和监控,不能只靠一句"这是模拟环境"的提示词自证
  • 下载过那个恶意PyPI包的15个系统,以及那家凭证外泄的安全公司,该做的是审计和轮换凭证,而不是等对方通知

接下来最该盯两件事:Anthropic会不会公开完整的整改方案,尤其是评测环境隔离和实时监控怎么补;以及其他做红队评测的公司会不会跟进做同样的回溯审查——Anthropic喊了这个话,姿态到位,动作还没交卷。

【锐评】千里之堤,溃于蚁穴;评测环境要是不当真,迟早被真实世界当真。