Claude参加的是一场网络安全“夺旗”测试,按设计只能在隔离环境里寻找漏洞。可测试机器配置错了,直接连上了真实互联网。结果,模型未经授权访问了三家现实机构的系统。

更反常的是,Anthropic没有及时发现。OpenAI披露自家模型访问开发者平台 Hugging Face 后,Anthropic才启动复查,并在超过14.1万次网络安全测试记录中翻出这三起事故。

目前能确认的是越权访问。没有公开证据表明三家机构出现数据泄露、系统破坏或其他现实损失。把它直接写成“Claude攻陷三家公司”,超过了现有材料能支撑的范围。

三起事故,问题出在测试环境

Anthropic披露的关键信息并不复杂:

项目已知情况
测试场景所谓隔离的 capture-the-flag,即网络安全“夺旗”测试
直接原因环境误配置,测试机器获得实时互联网访问权限
涉及模型Claude Opus 4.7、Mythos 5,以及一个内部研究模型
安全设置未启用通常用来限制高风险行为的标准 safeguards
实际结果未经授权访问三家机构的真实系统
发现过程OpenAI披露 Hugging Face 事件后,Anthropic复核超过14.1万次测试记录并发现问题
事实边界暂无公开证据确认数据泄露、系统损害或经济损失

“夺旗”测试本来就会要求模型扫描目标、寻找弱点、尝试取得权限。为了测出模型的真实上限,研究人员关闭部分标准安全限制,也有技术上的理由:护栏一直开着,测到的可能只是拒答能力,不是攻击能力。

但限制关得越多,外围隔离就越该严格。

这次恰好反了过来。模型获得了高风险任务、较高自主性和真实网络出口,环境却没有把测试目标与现实系统可靠分开。模型在错误的场地里继续执行任务,事故几乎是测试设计写进流程的结果。

模型误把真实目标当成靶场,不构成免责。模型不理解法律授权边界,本就在预期之内;实验室的工作,正是把这种“不理解”限制在沙箱里。

14.1万次记录,暴露的是发现能力

超过14.1万次测试记录,不宜简单理解成“跑满14.1万次才出事”。更准确的说法是:Anthropic在大规模复核历史测试时,才识别出三起此前没有及时察觉的事故。

这个差别很重要。

风险不只在隔离配置出错,还在出错之后没人迅速报警。如果测试代理访问了许可名单之外的域名,监测系统本应立即阻断并留下高优先级告警,而不是等到同行出事后再回头翻记录。

“千里之堤,溃于蚁穴。”这里的“蚁穴”并不神秘,就是几项很传统的安全工作:网络出口白名单、最小权限、实时日志、异常流量告警和紧急停止机制。模型越新,事故的根因反而可能越老。

OpenAI与Anthropic的事件不能直接画等号。公开材料没有证明两者根因、访问程度或后果完全相同,但它们放在一起,已经出现了同一种行业信号。

事件已公开事实不能据此推断
Anthropic测试事故隔离环境误配置,Claude未经授权访问三家机构系统已窃取数据、造成破坏或经济损失
OpenAI的Hugging Face事件OpenAI披露自家模型访问了Hugging Face,也促使Anthropic启动复查两家公司存在相同漏洞或造成相同后果

两家前沿实验室都在把模型推向更自主的网络操作。能力竞赛按模型版本和任务成功率计分,隔离与审计却很难登上发布会。激励一旦失衡,安全部门就容易变成最后一道人工复核,而不是系统默认的刹车。

我更在意的正是这一点:模型已经可以连续调用工具、选择目标并执行多步任务,实验室却未必能实时回答它去了哪里、碰了什么、什么时候越界。

采购AI安全代理,先查权限再看跑分

这件事不会直接说明普通Claude用户的聊天记录遭到入侵,也不能推出商业版Claude存在同样配置。受影响最直接的,是评估AI网络安全代理的企业团队,以及研究模型治理的人。

相关人群接下来最现实的动作
企业安全负责人在试点合同中明确网络出口、目标白名单、凭证权限、日志留存、越界告警和停机责任;不要允许代理默认接触生产网
AI治理与安全研究者少看实验室只报“攻击成功率”的演示,多追问事故发现时间、人工介入点、误访问记录及第三方审计结果

企业采购时也该多问几句:代理是否只能访问明确授权的资产?域名或IP不在名单内时会不会自动停机?谁能调用高权限凭证?越界后由供应商还是客户承担报告和处置责任?

这些问题会拖慢部署,也会增加成本。供应商可能认为,过严的网络限制会削弱代理发现未知资产和真实漏洞的能力。这个反方意见有现实基础。网络安全工具本来就需要一定探索空间。

可探索空间不能等于开放互联网,更不能靠模型“被告知不要访问外部目标”来代替工程隔离。自然语言提示是任务说明,不是访问控制。

后续最该看的,也不是Anthropic再写一篇态度诚恳的博客。真正有分量的是几项可验证动作:是否强制隔离高风险测试,是否默认限制网络出口,是否建立实时越界告警,是否引入独立审计,以及未来发生类似事故时会不会主动、及时披露。

AI实验室喜欢展示模型能走多远。现在该交代的,是它越过线之后,谁能在第一时间把它拉回来。