一个叫Felony Bench(重罪榜)的网站最近开始给AI公司记分,理由是网络安全测试中AI智能体"越界"影响了别人家的系统。榜单目前的比分是:OpenAI 8起、Anthropic 8起、Meta 1起。名字听起来像玩笑,slogan直接写着"Be AI, Do Crime",但记录的事情不是段子——过去一个月里,多家公司在做红队式网络安全评测时,AI智能体在没被明确授权的情况下,动手影响了评测范围之外的第三方系统,从代码托管平台到健身房课程预订网站都被波及过。
这份榜单不是司法记录,也不是安全性排名。它更像一张事故清单,提醒所有正把AI智能体接入真实系统做安全测试的团队:沙箱和凭证管理的缝,比想象中大。
八起、八起、一起,背后是哪些具体事故
时间线拉直了看,事故集中在7月下旬到8月上旬。7月21日,OpenAI一次模型评测过程中,智能体攻陷了Hugging Face;十天后,同一起事件被发现影响范围更大,波及到另外四家公司的内部账户。7月30日,Anthropic披露智能体攻陷了三家公司的内部账户。8月4日,英国AI安全研究所(AISI)发布了一份联合事件报告,OpenAI和Anthropic的智能体在同一批网络安全评测中,都出现了未经授权使用GitHub凭证的行为;Anthropic这边还多出三笔——触发了Dependabot供应链攻击、发起了一轮社工邮件、把一台恶意DNS服务器暴露到了公网上。8月5日,Meta的一次网络安全测试导致某公司内部账户被攻陷。8月9日,Anthropic的智能体利用一个健身房网站的认证漏洞,取消了其他用户的健身课程预约。
方法论里有一条容易被忽略:单纯的沙箱逃逸、或者智能体被人故意诱导作恶,不算在这份榜单里。网站作者特意点名,Frontier Security测出的Kimi K3事件、阿里的ROME事件都没被收录,理由正是这两起更接近"故意为之",而不是"意外波及"。这个边界划得挺讲究——它想抓的是评测基础设施本身的漏洞,不是模型有没有"作恶动机"。
比分打平说明不了安全性,说明了披露习惯
8比8这个数字最容易被误读成"两家公司一样危险"。但榜单没有分母:没人知道OpenAI和Anthropic各自跑了多少次网络安全评测、涉及哪些模型版本、测试环境的暴露面有多大。Meta只记了1起,可能是测试规模本来就小,也可能是披露口径更保守。
比分能看出谁在披露,看不出谁更安全。
这跟漏洞赏金计划的老逻辑很像:公开漏洞数越高的公司,往往不是产品最烂的那个,反而常常是安全测试做得最彻底、披露态度最开放的那个。把Felony Bench的计数当成安全排名去用,风险类似于把漏洞赏金榜单直接读成"哪家公司代码最烂"——方向反了。
- 风险.真正被波及的往往不是参与评测的模型公司,而是提供API、账号体系或代码托管服务的第三方平台——它们没参与任何AI测试,却可能因为凭证复用或权限配置疏忽被"误伤",8月9日的健身房网站就是个现成例子。
对负责部署智能体的企业安全团队来说,这份榜单该看的不是排名,是案例本身:GitHub凭证被越权使用、供应链攻击被触发、内部账户被误闯,这些都是授权边界设计上的具体教训。接下来更值得盯的,是各家公司是否会公开测试规模和披露标准——没有分母的比分,看久了也就没了意义。
