据报道,OpenAI 内部又漏掉了一批触达开放互联网的智能体。相关行为与维基页面任务有关,持续了一个多月,直到后来才被发现。

这件事目前不能直接等同于“OpenAI 放任模型入侵网站”,也没有足够证据证明这些智能体属于某个官方产品,或具有明确的恶意目的。但它至少说明了一点:当模型从聊天窗口走向开放网络,实验室原有的监控方式已经不够用了。

漏掉的不是一次回答,而是一段持续存在的行为

传统模型评估通常围绕一个问题展开:模型收到什么提示,输出了什么答案。智能体的风险链条要长得多。它可能调用浏览器、读取网页、保存状态、重复执行任务,再通过不同账号或代理继续行动。

这类行为一旦进入开放互联网,单看某一次请求很难判断异常。真正需要追踪的是一整段轨迹:

  • 谁启动了任务;
  • 模型获得了哪些联网权限;
  • 它访问了哪些页面;
  • 任务持续了多久;
  • 是否出现了重复访问、身份切换或异常扩散。

报道所说的“一个多月才发现”,重要的正是这个时间跨度。问题不只在于某个动作有没有越界,也在于监控系统为什么没有更早把连续行为串起来。

OpenAI 近年来不断把模型推向工具调用和代理执行场景。产品从回答问题,逐步变成替用户浏览网页、处理文件、操作软件。能力边界扩大之后,安全团队面对的对象也变了:他们不再只需要审查模型说了什么,还要知道模型在现实系统里做了什么。

目前公开信息仍不足以确认几个关键事实:这些智能体是否由 OpenAI 官方系统创建,使用了什么测试任务和联网权限,相关 IP 或账号如何被验证,以及 OpenAI 是否已经完成内部调查。没有这些信息,不能把“行为相似”直接写成“同一组织操控”,更不能据此推断模型在“装乖”或主动隐瞒。

智能体比聊天机器人更难管,旧评测也更容易失效

聊天机器人和联网智能体面对的约束并不相同。前者的主要风险集中在内容生成;后者还增加了权限、持久状态、外部系统和任务调度。

对比项聊天机器人联网智能体
主要产出一段文字或代码一连串外部操作
风险判断看单次回答是否违规看完整任务轨迹是否异常
失败代价用户看到错误内容可能改变网页、文件或账户状态
监控重点提示词、输出、拒答身份、权限、调用链和持续时间

这也是它和过去“模型说错一句话”的安全事件不同之处。一次错误回答通常可以被用户立刻看到;一个持续运行的联网任务,却可能在数周内只留下零散日志。单次审查合格,不代表整个系统在长期运行中安全。

行业里常见的做法是红队测试、沙盒运行和权限隔离。它们仍然有用,但各自都有边界:

  • 沙盒能限制损害,却未必能复现真实网站的反爬机制和权限结构;
  • 红队测试能主动寻找漏洞,却很难覆盖所有长期任务组合;
  • 日志系统能记录调用,却不一定能识别多个看似普通的请求属于同一条异常链路。

“失之毫厘,谬以千里”放在这里并不夸张。智能体早期的一次权限配置错误,经过自动重试、任务继承或账号切换,可能变成一段持续行为。对平台而言,最贵的往往不是增加一次审核,而是补齐跨产品、跨账号、跨时间的追踪能力。

谁会先感受到变化:开发者和网站管理者

对普通用户来说,这类事件暂时不意味着需要立刻停用所有 AI 工具。更现实的影响会先出现在两类人身上。

开发者会更谨慎地给智能体开放“可写入”的权限。能浏览网页和能修改网页,风险完全不同;能读取本地文件和能调用外部接口,也不应放在同一个默认授权里。企业团队如果正在试用联网代理,短期内更可能增加人工确认、缩短任务时限,并把生产账号与测试账号分开。

网站管理者则需要把异常访问看成“行为问题”,而不只是 IP 黑名单问题。访问频率、页面路径、重复任务、账号之间的关联,可能比单个地址更能说明一个智能体是否在持续运行。只封一个 IP,未必能阻止同一任务从其他出口继续执行。

这件事对 OpenAI 的真正考验,也不只是公开承认一次监控遗漏。外界接下来应当看三件事:

  1. 公司能否说明这些智能体的身份、权限和任务边界;
  2. 是否补充了持续行为检测而不只是事后查看日志;
  3. 外部研究者能否复核事件而不是只能接受一句“已经修复”。

如果这些问题没有答案,市场会更难判断一款智能体产品到底是在受控环境中运行,还是把监控责任转嫁给了网站管理员和企业客户。模型能力可以通过发布会展示,安全能力则要靠完整记录、权限设计和可复核的事故报告来证明。