一条提交在 OpenAI 内部私有代码仓库的拉取请求(PR #1186742),撕开了一场极具戏剧性的网络攻防战。三名白帽安全研究员借助 Anthropic 的 Claude 模型辅助,在不到72小时内打穿了 OpenAI 的外围服务,并一路横向渗透,直接拿到了员工的 Codex 权限,最终向其核心单体仓库(Monorepo)提交了访问证明。

外网随即传出“Claude 叛变黑入 OpenAI 偷走算法秘籍”的耸动叙事。但这并不是科幻小说里 AI 超智能觉醒的戏码,而是一场由三名人类黑客主导、AI 充当高阶外挂的精准突防。整场代号为 HEIF Heist 的测试历时约两个月,覆盖了多家主流厂商,消耗的 Claude 模型 Token 费用不足3000美元

HEIF Heist 渗透链路:从一张损坏图片到核心仓库 1. 恶意图片输入 上传特制 HEIC 文件 触碰 libheif 堆溢出 2. 论坛云容器 RCE Discourse 容器失守 突破外围应用层边界 3. SSO 鉴权横跳 接管员工身份凭证 跨越安全隔离域 4. 触达 Monorepo 调用员工 Codex 凭证 提交 PR #1186742 证明

一张损坏图片,如何撬动千亿巨头的代码库

这次攻击的入口普通得令人意外。OpenAI 搭建其官方开发者社区使用的是知名开源论坛系统 Discourse,由第三方云服务托管。

黑客首先盯上了图像处理流程中的底层解析组件。在论坛处理 AVIF 与 HEIC 格式图片时,底层依赖了广泛应用于 ImageMagick、libvips 等工具链的开源 C/C++ 解码器 libheif。这类底层原生库因历史包袱沉重与复杂的指针运算,极易出现堆缓冲区溢出等内存安全缺陷。

研究人员构造了一张特制的残损图片。上传到论坛后,直接在底层触发溢出并拿到了远程代码执行(RCE)权限, Discourse 容器被彻底接管。

真正的致命一击发生在应用破壳之后。原本论坛作为一个外围非核心业务,失陷也不至于直接危及生产核心。然而 OpenAI 在单点登录(SSO)的跨域信任链上出现了配置失误:低信任度的外部论坛身份与高权限的内部员工身份之间,缺乏实质隔离。

研究团队借此顺藤摸瓜接管了 OpenAI 员工的 ChatGPT 与 Codex 账号,再通过绑定的 GitHub 组织权限,长驱直入打通了 openai/openai 内部单体仓库。黑客并未下载核心代码,只是读取了部分元数据与提交记录,随后用受影响员工的 Codex 凭证提交了一条 Pull Request,敲响了警钟。

整个应急处置在约14小时内闭环。Discourse 迅速发布了编号为 GHSA-vhm9-85gw-x335 的安全公告,并对 ImageMagick 引入沙箱隔离;OpenAI 则在排查确认没有核心源码和客户数据泄露后,于2026年9月1日为这个 SSO 鉴权漏洞发放了 6500美元赏金,并重申托管论坛本身不在赏金范围内。

Claude 到底扮演了什么角色?

要理清这起事件,必须打破将 AI 拟人化、神化的叙事惯性。在这场测试中,Claude 并没有自主黑入任何系统,它是一把极度趁手的军工级开发杠杆。

堆缓冲区溢出利用从来都是安全工程中的脏活累活。即便发现了内存越界,黑客也需要针对目标系统的架构(ARM64 还是 x86-64)、内存分配器机制(如 jemalloc)以及 ASLR(地址空间布局随机化)等防护策略,编写极其精密的内存布局喷射和对齐代码。

大模型能力迭代带来的突防时间差 Claude Opus 4.8 阶段 生成代码难以稳定绕过 ASLR 复杂堆环境适配频频失败 Claude Opus 5 发布后(7月24日) 仅耗时约 3 小时 完成 ARM64 利用编写 数小时内成功适配至 x86-64 + jemalloc

在 Claude Opus 4.8 时代,研究人员多次尝试借其绕过 ASLR 防护,大模型给出的结果始终难以稳定利用。转变发生在2026年7月24日傍晚,Anthropic 推出了 Claude Opus 5。

研究人员当晚将目标堆状态输入模型,仅耗时约3小时就拿到了 ARM64 环境下可用的利用载荷,并在随后数小时内将其平移到了 Discourse 生产所用的 x86-64 与 jemalloc 组合上。次日上午10点,RCE 利用代码已经在测试环境完美跑通。

决定胜负的从不是 AI 自作主张,而是人类工程师握住了将几天代码工作缩至数小时的高速压榨机。

需要厘清的是,不少媒体误将此事与 Anthropic 同月公布的安全报告混作一谈。Anthropic 当时排查了4.81亿份对话转录,公布的是在内部安全评估中因测试网未断开导致的4起模型跨出沙箱连接外网事件。那是内部环境下的隔离疏漏,与外部研究员拿 Claude 当工具攻破 OpenAI 完全是两码事。


攻防的旧账,没法甩锅给新技术

翻开这起入侵的底层结构,没有一个概念是未知的。

一边是年久失修、广泛潜伏在开源软件供应链深处的 C/C++ 内存分配缺陷;另一边是企业在数字化扩张中,为了图省事将边缘社群应用与核心开发环境统合在同一套 SSO 信任体系下的架构懒政。

《周易》有云:“藉用白茅,无咎。慎斯术也。”讲的是立足之地越微贱,承托之物越要谨慎。网络安全的铁律向来如此:系统的抗风险上限,永远由它最薄弱的外围组件决定。

在传统攻防时代,将一个通用的内存泄漏漏洞改造为跨平台稳定的高危 RCE,通常需要资深漏洞专家耗费数周的繁琐调试与试错,这在客观上构建起一道时间防御墙。

如今大模型将这个研发门槛打得粉碎。Hacktron 的测试覆盖了包括 Slack、Meta、GitHub Enterprise 等一众顶尖科技体系,而他们耗费的 Token 账单折算下来仅有三千美元。在算力充沛的模型辅助下,冷门漏洞武器化已经变成了只要几小时就能完成的流水线作业。

  • 风险.边缘服务不再有非核心的安全屏障,跨域 SSO 若不进行严格权限降级,将成为直插内网的特洛伊木马。

OpenAI 愿意为 SSO 鉴权失误爽快支付 6500 美元,并在公告里特意将托管论坛排除在安全赏金之外,不过是在商业公关层面维系最后的体面。这起看似微小的 PR #1186742 提醒了所有人:当 AI 工具链将攻击迭代加速到小时级,守方若依然依赖未沙箱化的老旧开源库和漏洞百出的内网信任配置,失去代码库甚至生产控制权,只是时间问题。