7月22日,安全研究者Thomas Ptacek在评论OpenAI一次意外的网络攻击事件时,抛出一句判断:拿一个2025年的开放权重模型,配上渗透测试工具链,就可能完成沙箱逃逸,扫描并攻入大多数网络。这句话让人意外的地方只有一个——大家默认OpenAI的沙箱应该更牢固。问题不在模型强不强,而在沙箱和权限管得严不严

这不是一份公开的红队测试报告,Ptacek说的是他的专业判断,不是复现结果。但这句话点出一个容易被忽略的现实:当AI代理接上扫描、执行、联网这些工具,模型是不是"前沿",可能已经不是决定攻击能不能得手的关键变量。

判断的分量:不是模型太强,是权限给得太松

Ptacek评论的由头,是OpenAI一次针对Hugging Face的意外攻击事件。外界的第一反应通常是"前沿模型太强了",但Ptacek的说法反过来:换成开源模型也一样能做到,这才是让人不安的地方——攻击能力未必由模型代际决定。

这里有个背景条件容易被读者跳过:单独一个聊天模型,不会自己去扫端口、爬内网。Ptacek说的场景,前提是给模型接上渗透测试工具链——扫描器、执行权限、出站网络访问。没有这层工具和权限,再强的模型也只是在对话框里说话。

决定攻击能不能得手的,是什么 模型代际 2025年开放权重模型 OpenAI 前沿模型 推理能力有差异 ≠ 决定攻击成败 工具与权限 扫描工具接入 本地执行权限 出站网络访问 → 真正的攻防边界
沙箱失守不该归因于模型变强,而是权限给得太松。

谁该重新检查自己的沙箱

这条判断落到实处,最该看的是正在部署AI代理、且给它接了工具和内网访问权限的团队——安全负责人、红队、以及把Claude、GPT这类模型接入内部系统做自动化任务的工程团队。

具体该查的东西不复杂:沙箱逃逸面有没有堵住,代理拿到的权限是不是最小化,出站网络有没有限制到必要范围,操作是否留有审计记录。这几项跟模型是哪一代关系不大,跟部署时的配置关系很大。

  • 提醒.Ptacek的判断来自专家经验,不是公开复现的实证结果,企业不该把它当成"已验证的普遍事实",更不该假设所有开放权重模型天然危险——真正该做的是先审计自己给AI代理开了多少权限。

这件事也提醒一个常被忽略的对比:企业在选模型时常常纠结"要不要上前沿模型",但如果沙箱和权限没配好,模型选哪一代其实没那么重要。安全边界从"模型够不够强",实实在在地挪到了"代理能碰到什么"。