三名安全研究员借助 Anthropic 的 Claude 模型,拿下了 OpenAI 员工的账号,并把代码提交进了 OpenAI 的核心代码库。
这听起来像极了科幻小说里两家大模型巨头之间的赛博暗战。OpenAI 随后确认修复并支付了 6,500 美元 赏金,但公众最关心的其实是:AI 已经能自主入侵对手了吗?
答案很干脆:没有。这不是大模型生出了自主反骨,而是一次教科书级别的“专家把方向、AI 当苦力”的供应链穿透。
第一跳:一张 iPhone 照片砸开论坛后门
整起入侵的突破口极其接地气:OpenAI 官方开发者社区运行的第三方论坛软件 Discourse。

当 iPhone 用户在论坛上传系统默认的 HEIF 格式图片时,Discourse 后台会启动一套转码链路,先调取老牌图像处理工具 ImageMagick,再转包给底层解码库 libheif。
问题就出在 libheif 1.19.7 版本上。这里潜藏着一个堆缓冲区溢出缺陷,后被定级为 CVE-2026-32882,CVSS 评分高达 8.8。攻击者只要构造一张特制的图片,就能让转码程序在计算图层叠加位置时发生错乱,直接在容器内执行任意指令(RCE)。
荒诞的是,这个漏洞早在数月前就已经被上游开发者修掉了。
但当时这笔代码提交被当作普通维护,从未申请 CVE 编号,社区公告也只标成了后果轻微的越界读取。下游的 Discourse 根本不知道这里藏着致命风险,镜像更新自然停摆。直到 Discourse 发布紧急安全公告,提醒自建用户必须执行重建命令更新底层依赖,仅在后台点网页更新毫无作用。
隐蔽修复不仅防不住黑客,反倒把防御方变成了睁眼瞎。
第二跳:模型战力跨越与身份蔓延
如果只停留在论坛服务器被黑,这只是一起普通的边缘资产失陷。真正的转折点,是黑客手里的武器换代了。

来自 Hacktron AI 的三位研究员最初使用 Claude Opus 4.8 尝试编写利用代码。在关闭内存地址随机化(ASLR)的简化实验里模型尚可应对,可一旦面对真实的防护机制,它连续挣扎了几个会话都没能跑通。
转机发生在 Anthropic 上线新版 Opus 5 的当天。研究人员把相同的环境丢给新模型,模型在约 3 小时 内便生成了 ARM64 架构的利用载荷,随后迅速将其移植适配至线上复杂的 Linux 环境。
大模型并未凭空发明攻击手法,它跨越的是极其耗费心力的底层适配成本。它在极短时间内扫清了地址绕过和跨架构适配的脏活累活。当大模型遇到安全拒答时,研究员只是给提示词套了一层“我们在打 CTF 安全竞赛”的靶场外衣,模型的对齐防线便形同虚设。
突破容器之后,真正的特权蔓延才刚开始。
研究团队拿下了论坛服务器控制权,随即撞上了 OpenAI 自身的配置疏漏:企业单点登录(SSO)权限划分过宽。他们通过拦截凭据,接管了包括内部员工在内的多个 ChatGPT 和 Codex 账号。
而那位员工的 Codex 插件,正好绑定了 OpenAI 的 GitHub 组织权限。研究人员顺藤摸瓜,直接向代号为 openai/openai 的内部主代码库提交了无害的证明性 PR #1186742。
决定防御厚度的从来不是最高的那堵墙,而是最边缘那块踩脚石。
这一枪直接打穿了外围社区与核心工程之间那道薄薄的窗户纸。
攻防不对称的新常态
OpenAI 在收到漏洞报告后约 14 小时 内完成了修复,并在后续定级中支付了 6,500 美元 赏金。

OpenAI 坚称第三方论坛不在赏金范围内,这笔钱买单的是内部 SSO 权限的扩散缺陷。官方排查证实,攻击者只读取了极有限的元数据,并未伤及核心内网源码。这种就事论事的切割符合合规惯例,却挡不住现实的警钟。
黑客从不会按照企业画好的资产边界来进攻。只要论坛的账号能换来内部代码仓的凭据,边缘资产就是核心资产。
- 风险.现代企业引入大量 AI 编程助手与外部连接器,员工为了图方便往往赋予全局权限;一旦身份中继失守,原本被物理隔绝的开发内网将门户大开。
过去编写高难度二进制利用代码是极少数顶尖白帽的专利,需要漫长的汇编逆向和调试周期。如今前沿模型把这种昂贵的工程能力压成了随时可以调用的平价服务。
旧日开锁,尚需三年手艺;今日破门,只需租几个小时算力。当无 CVE 的开源暗坑遍布供应链,而大模型手里的撬棍又越磨越快,留给防守方慢条斯理排查的时间,已经不多了。
