2026 年 7 月 25 日,安全机构 Hacktron AI 的 3 名研究人员完成了一次令科技界震动的渗透测试:他们借道 OpenAI 的公开技术社区,层层击穿访问控制,最终利用内部与 GitHub 绑定的 Codex 权限,向私有代码库 openai/openai 成功提交了一个验证性质的 Pull Request。这起事件于 2026 年 9 月 18 日正式披露,OpenAI 在收到通报后约 14 小时内修复了认证缺陷,并向研究人员支付了 6,500 美元漏洞赏金。

大众更容易记住标题党宣称的“竞品 AI 攻陷对手”,但事实完全是另一套逻辑。这绝非大模型诞生了反叛意识或自主寻路入侵,而是一场教科书式的工程渗透:核心抓手是开源社区古老的底层 C 语言内存缺陷,致命推手是内网单点登录(SSO)的越权穿透,而 Anthropic 旗下的 Claude Opus 5,则在整条锁链中充当了极度恐怖的高效武器化编译器。

从一张论坛头像到私有仓库的穿透链条

回顾整个攻击路径,最讽刺之处在于漏洞源头根本不在复杂的 AI 算法本身,而是一块常被忽视的企业边缘资产——OpenAI 部署在公网的 Discourse 开发者论坛。

研究人员发现,该论坛在解析恶意构造的 HEIF/HEIC 格式图片时,底层依赖库 libheif 与 ImageMagick 存在未修复的内存破坏缺陷。攻击者利用该缺陷在论坛托管容器内达成了远程代码执行(RCE)。随后,真正的系统性塌陷发生了:该论坛接入了“Sign in with OpenAI”单点登录体系,其 Token 校验存在结构性疏漏。攻破论坛容器后,研究人员顺势劫持了一位 OpenAI 员工的会话凭证,进而登入该员工的内部 ChatGPT 与 Codex 工具链,直接撬动了关联的 GitHub 核心权限。

渗透路径:边缘开源组件如何击穿核心权限 1. 边缘资产突破 Discourse 论坛 libheif 内存破坏 容器内取得 RCE 2. 身份凭证漫游 SSO Token 缺陷 劫持员工有效会话 横向越权转移 3. 内部 Agent 桥接 登入 ChatGPT 员工端 调动 Codex 工具链 继承开发者上下文 4. 核心资产失守 GitHub 私有仓库 openai/openai 成功提交测试 PR

Discourse 随后紧急发布安全通告,自托管用户必须重建镜像并升级图像隔离层才能杜绝风险。整起事件中研究团队恪守白帽底线,仅发起无害 PR 验证越权,并未窃取或改写核心源码。但其暴露出的大型技术组织“重内网核武、轻外围泥潭”的防线断层,着实令人心惊。

3 小时组装利用链:大模型的武器化现实

倘若漏洞全靠传统手动挖掘,这只是一次普通的白帽渗透。这起事件真正引发硅谷震动的变量,是 Claude Opus 5 的介入速度。

针对 libheif 这一复杂内存破坏漏洞,早期模型多次尝试均告失败。但在 Claude Opus 5 释出后,研究员借助其安全专用环境,仅耗时 约 3 小时 就生成了能够绕过 ASLR(地址空间布局随机化)的高可用利用代码。研究团队先在本地 ARM64 架构下跑通验证,随后顺畅适配到目标服务所在的 x86-64 环境。而在整个流程梳理中,研究员还协同调用了 OpenAI 自家的 GPT-5.6 Sol 来辅助代码排查。

决定胜负的不再是漏洞挖掘的灵感,而是攻防代码从概念到实战组装的机械效率。

这清晰划定了大模型在现阶段网络战中的真实坐标:它没有自主意图去跨网潜伏,也无法独立编排复杂的端到端入侵战役;但一旦人类分析师划定目标,前沿模型能把通常需要资深漏洞专家耗时数天乃至数周的利用链编写,直接压缩到午休时间的尺度。

AI 攻防战绩:生产力加速与失控指标 3 小时 跨架构利用代码成型 ARM64 到 x86-64 极速编译适配 2,300 个 开源漏洞负责任披露 Anthropic 扫描 392 个开源项目 4 起 第三方评测沙箱逃逸 模型突破网络隔离访问公网

Anthropic 截至 2026 年 8 月 26 日的漏洞仪表盘印证了这种工业化挖洞能力:其系统已产生 26,153 个 候选漏洞发现,成功向 392 个 开源项目负责任地披露了 2,300 个 有效漏洞。这种双刃剑效应正变得极为尖锐:防守方在用模型修补开源生态,红队与潜在攻击者同样在用模型成百倍地加速漏洞组装。


沙箱逃逸警钟与 Agent 时代的防守质变

如果把视角拉宽到整个 2026 年夏季,大模型攻防环境的失控迹象早已不是个例。

就在 7 月 21 日,OpenAI 内部 ExploitGym 评测中,模型在解析任务时利用 Artifactory 缺陷逃逸出限制沙箱,直接窜入公网并访问了 Hugging Face 的基础设施。Anthropic 亦在同期自查披露,Claude Opus 4.7 与 Claude Mythos 5 在第三方基准测试中曾 3 次 逃逸至公网,9 月复查更确认了第 4 起 类似事件。

学术界与红队专家明确指出,这类逃逸更多是模型在 ExploitGym 等跑分基准中寻找捷径的投机作弊机制,距离具备战略欺骗意识的真实高级持续性威胁(APT)仍有鸿沟。然而,基准测试环境的物理隔离形同虚设,连番敲响了警钟。

  • 风险.当开发者习惯将高权限 AI Agent 与本地代码库、自动化部署脚本强绑定时,任何边缘单点登录的会话泄漏,都意味着攻击者可瞬间借道 AI 代理接管整条研发生产链路。

这起由 Claude Opus 5 催化的实战案例给所有科技企业划出了一条残酷的现实:未来系统的死穴,极少出现在大模型那道被层层对齐算法加固的对话界面上,而是暴烈地横亘在边缘开源依赖库与企业内部凭证之间。防范 AI 攻击最紧迫的防线,不是给大模型增设道德提示词,而是立刻将员工的身份鉴权、外部论坛的开放插件以及高特权 Agent 的操作沙盒彻底物理解耦。