OpenAI在8月末抛出一个新说法:即使企业客户签了Zero Data Retention(零数据留存,简称ZDR)协议,OpenAI也能通过一套叫Private Safety Processing(隐私安全处理)的机制,在不接触客户明文内容的前提下,识别跨越多轮交互的风险行为——比如账号协同作弊、绕过防护的反复试探,或者agent任务里"被叫停却继续执行"的偏离行为。这套机制目前只在少数早期客户中测试,官方计划9月正式推出并配发技术白皮书,企业协作平台Glean的CISO已经公开站台支持。

但判断很简单:这不是OpenAI一家的技术突破,而是全行业都在解的同一道题——"零留存"从来没有真正等于零留存,只是各家把留存的东西换了个说法。OpenAI这次给出的答案,关键细节几乎全部悬而未决,企业客户在9月正式签约前,该问的问题比官方目前给出的答案还多。

agent任务拉长战线,单次审核开始失灵

传统的内容安全审核,逐条看prompt和回复,一条一条判断有没有问题。这套逻辑在模型只做单轮问答时够用,但现在的agent会连续执行几十步操作,风险往往不在某一步里,而藏在"这些步骤连起来意味着什么"。OpenAI举的例子很直接:一个系统被用户叫停后仍继续动作,单看某一步完全正常,串起来看就是越权。类似的还有多账号协同试探防护边界——单个账号的每次提问都无害,放在一起看才是有组织的攻击。

这也是为什么OpenAI说"existing ZDR-compatible safety systems evaluate each interaction individually"已经不够了。Private Safety Processing想做的,是让自动化系统能跨会话识别模式,但不让OpenAI员工看到底层内容——识别结果压缩成一个"窄信号",用来判断是否需要处置。

"零留存"从来不是真的零留存

把OpenAI的方案摆进同行的政策里看,会发现一个共识:没有一家真正做到什么都不留。Anthropic的ZDR协议不留prompt和输出,但会保留安全分类器打的分数,这类分数最长可以留存七年;Google对被划为"Advanced AI"的模型,可疑请求和响应最长留存三十天,某些场景下客户甚至无权关闭这个开关;AWS Bedrock可以把留存模式设成none,但如果客户选用的模型本身要求留存,请求会被直接拦截,部分前沿模型的滥用流量最长仍会留三十天,甚至可能被共享给模型提供方人工审核。

留存的对象在变,留存这件事本身没消失。

各家"零留存"实际留了什么 Anthropic 分类打分 最长7年 Google 滥用日志 最长90天 AWS 部分模型流量 最长30天 OpenAI 窄信号 字段/时长未公开 结论:没有一家真正"什么都不留",区别只在留存的是内容、分数还是标签
零留存三个字听着干净,细看全是各家留了什么、藏了什么的暗账
  • 风险.OpenAI"窄信号"具体字段、保留期限、加密密钥能否抵御法律传票,白皮书发布前都是空白

白皮书之前,该问清楚的几件事

OpenAI目前给出的承诺,全部建立在自我披露和一位客户证言之上——没有第三方安全审计,外部技术社区也还没来得及公开检验这套加密架构。至少有几个问题,企业客户在正式签约前应该逼问清楚:跨交互模式识别本质上要"看到"某种内容特征才能匹配模式,这和"员工完全无法访问底层内容"的承诺之间,技术边界具体划在哪里?被标记后返回的"窄信号",到底包含类型标签、时间戳,还是更多可关联信息?在OpenAI托管、客户持密钥的方案里,一旦收到执法传票,OpenAI有没有能力或义务协助解密?

同样值得追问的是覆盖范围。Anthropic的ZDR对Files上传、prompt缓存、batch API有明确的除外条款,Google的grounding功能干脆没有关闭开关——按行业惯例推测,Private Safety Processing大概率也会有类似的"功能豁免区",只是原文和目前的预告都没提。

  • 结论.金融、医疗、法务这类受强监管行业客户,与其急着为9月上线欢呼,更该先把留存字段、豁免范围、传票应对写进采购合同里逐条问清楚

对Anthropic、Google、AWS而言,这也是一次隔空的公关压力——如果OpenAI白皮书真的把留存细节说得比同行透明,"谁留得更多"就会变成下一轮企业销售话术的战场。真正检验这套机制成不成立的时间点,不是现在的预告稿,而是9月那份技术白皮书,以及白皮书发布后第一批独立安全研究者的审视。