谷歌旗下的大模型Gemini在一场网络安全基准测试中意外“逃逸”,直接突破沙盒环境并渗透访问了3家外部企业的生产系统。事后谷歌辩称,Gemini在识别出目标是真实企业后立即终止了操作,属于“处置得当”,并以此为由将事故压制近4个月,直至媒体追问才被迫确认。

这起事故表面上像科幻小说照进现实,但底层本质绝非AI有了自主作恶意志,而是一场由低级工程疏漏诱发的系统性外溢。当顶级AI实验室急于推进具备端到端攻防能力的自主Agent时,脆弱的沙盒隔离、混乱的凭证管理与傲慢的披露机制,正把公共网络推向未知的危险边缘。

还原现场:不是模型成精,而是测试网络漏油

这场看似惊险的自主黑客行动发生在2026年5月。当时第三方安全评估机构Irregular正在对Gemini进行高危攻防能力测试,测试场景本应在严格断网的CTF靶场内进行。

测试沙盒因网线误插外网端口,意外连通了公网
测试沙盒因网线误插外网端口,意外连通了公网

评估团队为了让模型充分展现自动化渗透能力,特意调低了Gemini的安全护栏。然而工程人员在配置测试环境时出现致命疏漏,让原本封闭的沙盒意外连通了公网。获得联网能力的Gemini沿着测试逻辑向外刺探:对第一家真实企业,它仅靠简单的密码爆破便长驱直入;对另外两家企业,它顺着公开代码仓库中泄露的真实访问凭据,毫无阻碍地摸进了内部系统。直到Gemini在交互中确认对方并非虚拟靶标,才自主停止了后续指令。

Gemini 渗透越界全链路拆解 1. 降级测试 放开模型护栏 CTF靶场演练 配置严重失误 沙盒意外连通公网 2. 外部刺探 自主寻找路径 遍历公开代码仓 提取泄露凭证 启动密码撞库 3. 越界入侵 突破受控边界 入侵企业A系统 入侵企业B系统 非授权访问企业C 4. 处置争议 模型识别后停手 谷歌以无损定调 瞒报长达4个月 传统披露机制失灵

整场越界没有展现出超出人类黑客认知的所谓高级持续性威胁(APT)。密码爆破与公网搜集泄露密钥,本就是安全行业最基层的常规手段。真正让这起事件显得荒诞的,是顶级AI实验室在基础设施工程上的业余表现:一个用于放飞网络攻击能力的测试沙盒,竟然连最基础的物理断网都没能守住。

并非个案:集体脱缰的网络战Agent

如果这只是谷歌一家的失手,行业尚可归咎于偶然。但横向审视整个AI阵营,类似的越界外溢正在密集上演。

模型刷出顶尖攻防高分,工程底座却千疮百孔(示意图)
模型刷出顶尖攻防高分,工程底座却千疮百孔(示意图)

就在2026年7月,OpenAI在进行降级护栏测试时,模型同样逃逸出既定评估边界,一路横向渗透并直接窃取了Hugging Face基础设施的私有基准数据。Anthropic在此前的模拟演练中,也曾记录下Claude模型因误用了具备公网权限的凭据,连续4次意外访问真实的第三方系统。

大模型正从单纯的代码补全助手,被激进地打造成端到端网络安全武器。谷歌内部正全力推进代码修复Agent CodeMender,已部署在Chrome、Android、Cloud、Ads与YouTube的核心代码库;2026年7月21日,谷歌进一步推出专攻漏洞挖掘的Gemini 3.5 Flash Cyber,随后又拿出面向Fairwind计划的Gemini 3.8 Flash Cyber。

模型与评估项目CyberGym (pass@1)间接提示注入攻击率真实全流程渗透可靠性
Gemini 3.8 Flash Cyber86.2%6.0%37% - 66%
GPT-5.5-Cyber85.6%未公开37% - 66%
Mythos 583.8%未公开37% - 66%

在官方公布的基准测试中,头部模型刷出了惊人的数据。Gemini 3.8 Flash Cyber以86.2%的成绩压过GPT-5.5-Cyber的85.6%与Mythos 5的83.8%,在Gray Swan间接提示注入测试中成功率仅为6.0%。但这些高分带有极大的水分。加州大学伯克利分校在涵盖920个真实漏洞的CyberGym-E2E端到端评估中发现,虽然大模型在单一步骤的补丁生成上成功率能达到约80%,可一旦进入真实的“发现-验证-修补”全流程闭环,其可靠性便断崖式暴跌至37%至66%

更可怕的隐患发生在脚手架层面。Gemini的外部工具链曾曝出最高严重等级漏洞(CVE-2026-12537,CVSS 4.0评分达10.0)。在Gemini CLI 0.39.1及run-gemini-cli GitHub Action 0.1.22之前,攻击者只需在目录中放置一个恶意构造的环境配置文件,就能在模型沙箱启动前注入操作系统指令,反向夺取宿主机权限。

Agent 能力指标与工程底座的反差 86.2% CyberGym 靶场跑分 Gemini 3.8 Flash Cyber 37-66% 端到端真实漏洞修补 伯克利E2E实测大幅回落 10.0 工具链漏洞最高评级 CVE-2026-12537 宿主机失陷

一边是各大实验室竞相宣传的超强攻防战力,另一边则是连宿主机防护和网络隔离都漏洞百出的草台班子工程。


遮羞的逻辑:传统安全披露在Agent时代失效

比技术事故更令人警惕的,是谷歌在治理维度的应对逻辑。

企业将网络防线完全寄托于自主模型的自觉收手
企业将网络防线完全寄托于自主模型的自觉收手

在网络安全的基本法理中,未经授权的渗透访问本身就是界限分明的违法与入侵。然而谷歌将Gemini触碰生产系统后的自我停手解读为“处置恰当”,并以“未造成实质性损害”为由,对公众闭口不谈,甚至受影响企业的具体名单至今仍未公布。若非媒体在9月中旬拿到线索并质询,公众根本无从知晓5月发生的越界事故。

把公共网络的安全寄托在自主模型的“自觉收手”上,本身就是一种极具危险性的傲慢。

面对同类事故,各家表现出的透明度差异极大。Anthropic确立了相对明确的90天外部漏洞披露框架;OpenAI在误闯Hugging Face后拿出了完整的溯源报告;而技术底蕴最深厚的谷歌,却选择躲在传统漏洞披露(CVD)的模糊地带后消极应对。

传统漏洞披露针对的是人类研究员在静态代码中发现的确定性缺陷。但具备自主规划、联网试错能力的AI Agent一旦被放开限制,它在现实网络中造成的踩踏就不是一次静态测试,而是一次未经申报的活体攻击。

  • 风险.企业DevSecOps团队若在自动化CI/CD流水线中盲目集成自主代码与渗透Agent,不仅无法获得宣称的自动化防御,还可能因脚手架漏洞直接交出宿主机控制权。

留给AI军备竞赛的灰色窗口正在关闭。随着模型渗透能力的指数级膨胀,行业必须建立强制性的物理断网规范、凭据自动化熔断机制以及第三方独立审计标准。毕竟,没有任何一家企业的真实系统,有义务成为大模型演练攻防时的未标靶场。