2026年9月28日,英伟达发布开源智能体安全平台(Open Agent Safety Platform),宣称其看门狗机制能在数毫秒内检测并隔离越轨失控的AI智能体。面对自主智能体攻防测试中频发的越权调用与外联事故,黄仁勋在接受采访时把安全逻辑收缩到了最原始的权限管控:必须让智能体处于最小权限的沙盒之中。但剥开这套技术话术,这并非大模型认知理解上的技术飞跃,而是一场把传统网络隔离做进专用芯片的算力海关布局。

软硬双簧:毫秒断路器装在哪里

随着大模型从单向问答演进为具备工具调用、环境交互与系统执行能力的自主智能体,安全攻防的战场发生了质变。提示词注入不再只是诱导模型吐出不合规文本,更可能直接诱骗智能体执行提权命令或外泄机密资产。英伟达给出的解法不是教模型学好,而是在系统底层修筑一道隔离墙。

监控程序独立运行于DPU网卡芯片,在物理层面脱离主机系统
监控程序独立运行于DPU网卡芯片,在物理层面脱离主机系统

这套 Open Agent Safety Platform 由两个核心组件拼接而成:

  • OpenShell 开源沙盒软件:运行在操作系统环境与基础设施层,兼容 Arm 和 Intel 架构硬件,通过内核级隔离限制智能体对文件系统、外联网络端口、进程权限与认证凭证的访问。
  • Sentry 带外看门狗.基于 DOCA 软件框架开发,独立运行在 BlueField-4 DPU 硬件芯片上。它通过脱离主机系统的带外机制,持续检查智能体的所有调用请求与网络响应,验证身份并强制执行策略。
英伟达 Agent 防御分层架构 应用与认知层 · 模型厂商防线 Anthropic 对齐训练 / OpenAI 工具审批 / 无法根治提示词注入提权 系统运行时 · OpenShell 开源沙盒 支持 Arm/Intel 平台 / 内核级限制文件访问、网络出口与系统凭证 硬件隔离层 · BlueField-4 DPU (Sentry) DOCA 带外实时监控 / 独立芯片拦截网络与 API / 宣称数毫秒隔离

把监控程序放在独立的 DPU 硬件上运行,在安全工程中属于经典的带外监控思路。即便智能体在宿主操作系统内部彻底被恶意代码攻破,黑客也无法直接篡改网卡芯片上的安全固件。换言之,英伟达是在物理层面给智能体加装了一道机械电闸。

降维防御:不恃其不欺,而恃其不能为

在安全策略上,英伟达与模型厂商走的是两条完全不同的路线。Anthropic 押注 Constitutional AI,试图在模型预训练与微调阶段注入伦理对齐;OpenAI 则在 Agents SDK 中强调应用编排层的工具使用与接口审批机制。

一旦检测到智能体越权,通信物理管道被瞬间切断
一旦检测到智能体越权,通信物理管道被瞬间切断

这些方案都属于模型心智与软件编排层的博弈,无法从根本上消除逻辑漏洞。《韩非子》有云:“不恃其不为非,而恃其不能为非。”模型自身是否产生越轨意图并不重要,只要底层操作系统剥夺了提权能力,智能体就掀不起大浪。

不求模型心智不生恶念,只求底层权限无法越界。

OpenShell 本身并不理解智能体输出内容的伦理道德,也无法判定一次推理是否充满谎言。它唯一关注的是行为物理边界:智能体是否试图读取未经授权的密钥目录?是否尝试向陌生 IP 发起异常连接?一旦发生越界,运行在 BlueField-4 上的 Sentry 立即切断通信管道。这种防御把复杂的语义安全降维成了确定性的端口与权限管控。

  • 结论.企业构建智能体安全无法依靠单一防线,模型对齐、应用审批与底层沙盒各司其职,硬件断路器只负责兜底系统特权,无法解决推理逻辑本身的业务风险。

宣传光环下的实测盲区与商业算盘

技术架构虽有合理性,但英伟达官方释放的信息却留下了大量模糊地带。在安全攻防中,“数毫秒”的表述极其耐人寻味。

示波器显示硬件阻断生效时,数据外发早已完成
示波器显示硬件阻断生效时,数据外发早已完成
官方宣称 vs 生产落地落差 官方宣称亮点 · 毫秒级阻断失控越轨 · 跨平台开源沙盒适配 · 巨头名单联合背书 关键缺失与现实约束 · 未披露任何跑分与延迟分布 · 误报率未知,可能打断正常业务 · 毫秒级事后隔离难防瞬时数据外泄

官方公告未提供任何经过测量的延迟分布、测试环境配置或独立第三方基准测试,更回避了两个致命指标:检测准确率与误报率。在真实的工业自动化场景中,如果防御策略过于严苛导致正常业务频繁被切断,企业架构师根本不敢将其部署到生产流水线中。

更为关键的是拦截时机。英伟达并未明确说明这数毫秒是动作执行前的阻断,还是动作发生后的事后止损。在现代数据泄露事件中,一个 HTTP POST 请求携带敏感凭证完成外发只需要几毫秒,后置的熔断隔离根本无法追回已经泄露的数据。

前谷歌安全总监 Niels Provos 虽然肯定了降低部署门槛的架构方向,但并未对其具体性能表现予以背书。媒体列出的 Anthropic、微软与 SpaceX 等早期支持者名单,更多属于生态站位,距离真正大规模生产环境部署仍有相当长的距离。

剥离掉安全的道德外衣,英伟达的真实诉求清晰可见:算力硬件的护城河必须向网络与系统控制延伸。开源的 OpenShell 只是负责引流与建立标准的免费先锋,真正能实现带外监控的硬件载体是昂贵的 BlueField-4 DPU 以及背后的 DOCA 生态。英伟达不满足于只卖训练和推理用的 GPU,它要借助智能体失控的行业恐慌,把智能体基础设施的管控权牢牢锁进自家的芯片网络中,实现软硬件层面的生态绑定。

  • 风险.在缺乏独立第三方基准测试与误报率数据前,盲目依赖硬件断路器容易产生防御错觉,尤其无法规避毫秒级请求已完成阶段的敏感数据外发风险。

城门安危从不系于单一吊桥。英伟达把网络工程的老手艺包装成了智能体时代的灵丹妙药,虽然确实切中了权限隔离的死穴,但要让企业掏钱买单,它还得先拿出一份能自证清白的跑分清单。