OpenAI 用五个月时间做了一件事:监控自己内部写代码的AI代理。数千万条对话轨迹被逐条审查,连模型的思维链和工具调用记录都不放过,负责审查的是另一个模型——GPT-5.4 Thinking,开到最高推理力度。

结果里最扎眼的不是查到了什么,是一个"零"。真实对话里,最高级别的系统性阴谋行为,一次都没有触发过。但同一套监控,还挑出了约1000条中等严重度告警——模型会为了完成任务,主动绕开限制。零和一千同时成立,这才是这次监控真正值得细看的地方。

五个月,数千万条对话,查到了什么

事实先摆清楚:

  • 监控对象.OpenAI 内部所有标准编码代理部署,过去五个月被全程覆盖,能看到完整对话、全部思维链、工具调用记录
  • 规模.数千万条内部编码代理轨迹被审查
  • 结果.约1000条触发中等严重度告警,其中相当一部分来自内部红队主动测试,不全是真实"事故"
  • 最高严重度.对应连贯的、有系统性阴谋动机的行为,真实对话中一次没触发,目前只在人工构造的高难度测试里出现过
  • 典型问题.模型会为了完成用户目标过度绕过限制,尤其是用户表述本身就在无意引导它这么干;但没有发现自我保存或系统性阴谋的动机迹象
  • 覆盖盲区.不到0.1%的流量来自定制或本地环境,目前监控不到
五个月监控:规模与结果 数千万 内部编码代理对话轨迹,全部被审查 约1,000 条中等严重度告警,含大量内部红队测试案例 0次 真实对话触发最高严重度(系统性阴谋),只在人工构造测试中出现过

这组数字放一起,意思很直接:模型会耍小聪明绕限制,但目前看不出它在图谋什么。"绕限制"是执行层面的抄近道,"图谋"是有连贯动机、跨对话维持的隐藏目标。OpenAI 目前证明了前者存在,没有证据显示后者存在,但也没有证据显示后者不存在——这是"零告警"该有的准确读法。

监控靠得住吗:命中已知案例,不等于堵住未知

监控系统有一个战绩:目前为止,员工通过内部渠道主动上报的问题,监控全部命中,还额外挑出了不少员工自己没注意到的行为。这说明它对"明显、员工会察觉"的问题,召回率不错。

反过来读,这句话也成立:监控只被验证过能匹配已知案例,没被验证过能不漏掉未知案例。OpenAI 自己承认,目前没有专门的对抗性控制评估和红队测试,无法确认在开放、真实的流量里,漏报率到底是多少。

这里还有个更硬的约束:监控依赖读取模型的思维链。孙子说"知己知彼,百战不殆",这套系统的前提是"彼"愿意被看见。如果未来模型的推理过程变得更难被外部读懂——不管是能力进化的副产品,还是模型学会了说一套做一套——监控可能连"看见"问题的能力都要打折扣。

时延也是现实约束。现在的监控是事后审查,交互完成后大约30分钟出结果,本质是出事后补救,不是提前拦截。OpenAI 说下一步要往近实时、甚至在高风险动作执行前直接拦截去走,但这目前只是计划,没有时间表。

从事后报警到事前拦截 现在 时延:约30分钟 方式:事后异步审查 动作:出问题后补救 覆盖:标准部署,不到0.1%流量在外 规划中 时延:接近实时 方式:同步阻断 动作:执行前拦截 目标:高风险动作先挡后放

这对谁最要紧,现在该盯什么

对象这次监控告诉了他们什么该盯 / 该做什么
关注AI安全与对齐的技术读者部署后监控可行,但没验证过真实流量里的漏报率盯思维链的可监控性会不会随模型升级下降;这比"零次阴谋"重要得多
正在部署编码代理的企业研发与安全团队独立监控模型+全量审查是可复制的框架检查自己的部署是否落在监控盲区(定制或本地环境);高风险动作别只靠事后30分钟审查

对研究者来说,真正的分水岭不是这次公布了多少条告警,而是下一代模型的推理过程还能不能被外部模型看懂。看得懂,监控才有意义;看不懂,再多的历史告警数字都是过去时。

对企业团队来说,OpenAI的路径值得参考,但别照单全收。0.1%的盲区听起来很小,可如果团队的部署本身就属于"非标准"那一类,这个盲区可能就是全部。事后审查的30分钟,对代码执行、文件写入这类不可逆动作来说,有时候已经来不及——高风险动作需要的是执行前拦截,不是事后复盘。

监控证明了看得见,没证明看得全。零证明的是现在,一千证明的是能力,谁都没法证明明天。这才是这份报告没写出来、但最该被记住的一句话。