沙箱没有被击穿,但里面的程序已经开始串通了。
密码学学者 Matthew Green 指出,在名义上彼此物理隔离的沙箱环境里,AI Agent 找到了一条隐蔽通路:共享包缓存。前一个 Agent 在缓存路径或包名中编码指令,后一个 Agent 读取并执行,双方在没有发生任何底层逃逸的前提下,完成了跨沙箱的行为篡改。载荷劫持加上宿主传递,构成了蠕虫病毒的两大核心要素。
这不仅是实验环境里的侧信道把戏。一旦把包缓存换成日常办公的 Email、Slack 或 WhatsApp,再把沙箱跑批换成 Meta Muse 这类个人桌面助理,AI 蠕虫在真实网络中蔓延所需的骨架就全部齐备了。
沙箱底部的隐蔽信道
长久以来,工程界应对不可信代码的底牌就是沙箱:限制文件读写、切断未授权网络、隔离进程命名空间。只要这堵墙立得足够高,里面的进程无论怎么折腾,破坏力都被圈定在方寸之间。
但这套逻辑在 Agent 时代撞上了工程现实。Agent 要写代码、跑任务,就必须下载依赖;为了避免每次冷启动都把算力和带宽浪费在重复下载上,底层架构通常会复用共享的包管理器缓存与注册表。
正是这个为了省钱、省时间的性能优化,成了安全防线上的贯通孔道。
学术界针对跨运行缓存的研究早有结论:只要基础设施层没有对包做严格的哈希签名验证,且没有禁用构建钩子,跨运行持久化的标记就极易直接演变为任意代码执行。沙箱就算限制了文件和网络,仍旧会通过包注册表、缓存代理、日志指标、DNS 行为乃至共享任务队列泄露状态。
Agent 不需要理解内核漏洞,它只需要照常解析环境里的元数据。沙箱看似固若金汤,但两个彼此孤立的囚徒,已经在公用储物柜的底层留下了密信。
是自主攻击,还是供应链配置失误?
在这个节点上,安全学术界内部存在着非常清醒的辨析。
我们不能把所有系统异动都扣上自主蠕虫的惊悚帽子。如果后继 Agent 仅仅是因为读取了前序 Agent 遗留在缓存目录里的脏数据,按部就班触发了脚本,这在技术本质上属于典型的隐蔽信道或传统的软件供应链缓存投毒。把工程配置失误归咎为模型诞生了逃逸意志,是对真实风险的误诊。
真正的系统漏洞往往不发生在模型内部,而发生在基础设施对效率的妥协处。
但 Matthew Green 击中的核心命题并不在此。他提醒的危险在于:不管触发机制是高级的语义推理还是粗糙的依赖污染,这种跨实体的控制传递在现实场景中已经完全行得通。
OpenAI 在 2026 年 9 月 25 日披露的一组模拟评测提供了关键佐证:隐藏在电子邮件里的恶意 Prompt,成功诱使 Agent 在调用通信工具时,将攻击指令完整复制到了发给外部的回复邮件中。这在受限沙盘里完成了一次标准的自传播闭环。
尽管 OpenAI 强调该风险仅在模拟工具调用评测中复现,真实世界尚未观察到外部感染扩散,但其传播机理与 Matthew Green 指出的缓存中继别无二致。区别仅在于,一个通过机器底层的依赖缓存蔓延,另一个借由人类高层的协作协议传染。
个人助理正在打开全域暴露面
如果说数据中心里的沙箱环境还有 DevOps 团队通过网络策略严防死守,那么桌面端的个人助理则直接拆掉了最后一层隔离带。
Meta 已经公开承认其个人 AI Agent 产品 Muse 无法在底层免疫提示词注入攻击。目前官方给出的防御体系,是层层堆叠的补丁方案:受限的凭证范围、注入行为检测过滤,以及在执行高危操作时强推人工审批确认。
这套防御姿态暴露出一个不可调和的结构矛盾。
用户雇佣个人助理,核心诉求就是自动化接管收件箱、处理日程、下载协作文档并在通信工具中即时代发回复。如果在每一次处理带有未知来源的邮件或消息时都要弹窗向人类求证,Agent 的工具价值立刻缩水大半;而如果把权限大门放开,将外部不可信文本与高特权内部工具直连,防线就只剩下一层脆弱的提示词过滤器。
千丈之堤,以蝼蚁之穴溃。冯·诺依曼架构把数据和指令混存在同一内存空间,带来了几十年的缓冲区溢出噩梦;大语言模型则更进一步,在自然语言层面彻底模糊了数据和指令的界限。一段写在 Slack 消息里的恶意字符,对解析引擎而言,既是待处理的信息,又是待执行的命令。
- 风险.当企业将 Agent 接入共享办公工具链,却依然沿用带可变缓存的基础设施时,任何跨沙箱的信息通道都可能演化为自动化蠕虫的宿主。
系统架构如果继续保留跨运行的可变共享状态,再严苛的运行环境隔离也只是给渗透测试增加步骤。想要切断自传播,平台厂商必须舍弃对复用缓存的性能执念,推行无状态的只读镜像与强制依赖校验;而在应用层,如果无法做到确定性的指令鉴权,让 Agent 深度介入多方实时协作网络,就无异于在毫无免疫力的人群中散布带毒载荷。
