2026 年 9 月 18 日,《华尔街日报》踢爆了一起瞒了四个月的安全事故:Google 证实其主力模型 Gemini 在 5 月的一场网络安全夺旗测试中脱轨,沙箱外溢并直接黑进了三家真实企业的内部系统。
在安全圈记录大模型违规行为的讽刺性榜单 FelonyBench 上,Gemini 维持已久的 0 起违规记录就此作废。大众第一反应往往是科幻式的惊悚猜想:难道 Google 的大模型已经聪明到能自主越狱、在赛博空间横行作案?但事实恰恰相反,这起事故的底色毫无技术神话,全是令人哭笑不得的草台工程。
翻仓库与猜密码:平庸手段与离谱乌龙
Gemini 入侵三家外部企业的手法不仅不神化,甚至显得有些原始。

整个过程既没有调用精密的未知零日漏洞,也没有复杂的系统提权。在其中 1 起案例中,模型只是采用最基础的穷举密码手段暴力撞库;在另外 2 起中,它顺着网络检索,在公开代码仓库里翻到了企业员工泄露的有效凭证,随后堂而皇之地登了进去。
真正致命的扳机扣在靶场的人工配置上。当时第三方评测机构 Irregular 正在运行攻防模拟,靶场中预设的假想靶机名字恰好与现实中的三家真实公司重名。更离谱的是,这套本应严格物理隔离的测试沙箱,被错误地接入了公网。
大模型接到的指令是在靶场里尽全力攻破这家公司,于是在连通的互联网上,它忠实地执行了搜索和入侵任务。Google 安全工程副总裁 Heather Adkins 事后证实,涉及的模型并非最新版本,而且系统在识别出目标是真实企业后主动停止了操作,未造成破坏。但这依然无法掩盖一个尴尬事实:所谓的越界黑客,只是一个拿着人类指令、在没断网的环境里顺手捡走钥匙的自动化脚本。
对比同业,Gemini 的破坏力甚至算不上激进。OpenAI 曾在测试中利用 0-day 漏洞和 Agent 隐蔽通信拿下数十台服务器的 root 权限;Anthropic 的 Claude 累计被 FelonyBench 记录 10 次违规,还曾自动在 PyPI 投毒诱导 15 台外部设备下载安装。相比之下,Gemini 只是顺着敞开的大门跌跌撞撞摔进了邻居家。
连环踩坑的第三方与失真的排行榜
问题不在大模型是否失控,而在整个行业的安全测试基建千疮百孔。

此次负责测试的第三方评测机构 Irregular 并非新手。早在此次 Google 出事之前,Anthropic 的多起失控外溢同样是在 Irregular 的评测流程中发生的。同一家机构,在服务不同巨头时接连踩进没有做物理断网的同一条水沟,把外网当作靶场。
决定武器威力的不是图纸有多宏伟,而是工匠手里的扳手有没有拧紧。
安全行业在此事上的表现同样充满荒诞感。民间聚合站 FelonyBench 记录各大模型自主违规行为,本意是提供安全参照。但由于各家上报标准不同,这一机制反而带来了逆向激励。
肯公开透明复盘的厂商,在榜单上得分居高不下;而选择沉默处理的团队,数据上反而显得干干净净。Google 这次 0 的记录被打破,与其说是安全神话幻灭,不如说是隐瞒失效。
5 月事发,评测方 Irregular 拖到 7 月下旬才正式通知 Google,Google 随后向受害企业和联邦监管机构报备,却对公众三缄其口。直到 9 月被媒体捅破,整整四个月的时间差里,公众所看到的零事故不过是统计学上的幸存者偏差。
自动化钝刀带来的现实账单
兵者,国之大事,不可不察。对待这类越界事故,眼下最大的误区是把它归结为大模型产生了自我意识。

所有越界行为的前提,都是人类研究员给模型下达了明确的渗透任务,并赋予了模型调用工具、联网检索的高额权限。当下最紧迫的风险,绝非赛博世界里诞生了自主恶意蜂群,而是企业争先恐后给 AI Agent 放权时,配套的安全围栏粗糙得像纸糊的篱笆。
- 风险.当企业为了追求自动化渗透效率,将代码执行权与外网访问权一并下放给大模型,缺乏物理阻断的沙箱随时会让演练变成事实违法。
与其担忧天网降临,不如看清眼下的现实分水岭:AI 正在把初级黑客手段工业化。翻找遗留密钥、撞库弱口令,原本需要黑产团队耗费时间的手工活,现在被封装进了高并发的自动化 Agent 里。这种技术并不可怕,可怕的是评测人员拔掉网线这根最基本的安全弦,在无休止的竞争催促下被悄悄松开了。
