OpenAI 在 2026 年 9 月 16 日正式上线了模型偏离报告框架(Misalignment Reporting Framework),并顺手公布了 6 起涉及数据捏造等问题的内部偏离案例。官方特意强调,这些案例均未波及真实用户,同时在文件里声明这绝非所有已知事故的详尽记录。把几件已经解决且没有造成外溢伤害的实验室内瑕疵端出来,配上一套看似严密的自我纠错机制,OpenAI 想给外界展现的是负责任巨头的自我约束。

但我更在意的是它出台的时间点与字里行间的权力回缩。表面看是技术治理的自愿开放,骨子里却是一场教科书级别的防御性合规

OpenAI 安全治理承诺演变:审计权力的内部收拢 2023 测试版准备度框架 • 承诺由合格独立第三方展开审计 • 外部专业力量介入红队测试 • 覆盖广泛的社会影响力风险 2025/2026 现行报告体系 • 删除通用独立审计,设为自由裁量项 • SAG 成员由领导层直接任命与管理 • 移出说服力风险,领导层拥有一票裁决权

悄然倒退的独立审计与收缩的边界

如果你翻出 OpenAI 在 2023 年公布的测试版准备度框架(Preparedness Framework),就会发现一个极为扎眼的落差:当年写在纸面上的独立第三方审计承诺,在 2025 年至 2026 年的版本更迭中已经被悄悄抹去。

安全框架被改造成领导层直接掌控的内部防御工具(示意图)
安全框架被改造成领导层直接掌控的内部防御工具(示意图)

在现行的规则文本里,第三方评估不再是必经的前置关卡,而是被降格为仅在 OpenAI 自行判定为“有必要、可用且可行”时的自由裁量项。换句话说,外部专家能不能进场看代码、查权重、翻日志,完全由公司自己说了算。

负责安全把关的内部安全咨询小组(SAG),其成员全部由公司领导层直接任命。更关键的是制度设计上的底牌:领导层享有最终部署决定权,并且可以在没有任何 SAG 成员参与的情况下直接行动。不仅如此,OpenAI 还在框架修订中将说服力风险(persuasion)直接剔除出了核心覆盖范围。模型如何潜移默化操纵用户认知这类渐进式危害被搁置一边,换来的是一套被高度净化的内部安全流程。

当评测标准、风险裁定与最终发布的解释权都在同一张办公桌上,安全框架就成了知识产权的防弹衣。
  • 风险.企业自行界定何为偏离并掌控调查节奏,会导致真正具备系统性危害的模型漏洞被技术性规避或内部消化。

算准日历的合规抢跑

这套动作之所以在这个秋天出炉,原因不在实验室内部,而在立法机构的日程表上。公权力对前沿 AI 的硬性规制正在密集收网。

赶在公权力巨额罚金生效前抢跑发布自律报告(示意图)
赶在公权力巨额罚金生效前抢跑发布自律报告(示意图)

加州 SB 53 法案已于 2026 年 1 月 1 日正式生效,明确要求前沿大模型开发者必须建立安全框架并向官方如实报告严重安全事故,加州总检察长可对违规行为处以最高每次 100 万美元的民事罚款。而在大西洋另一端,欧盟《人工智能法案》针对通用 AI 模型的系统性风险合规要求,也在 2026 年 8 月 2 日全面开启强制执法,监管部门不仅有权要求通报严重事故,更拥有直接指定外部专家进驻评估的法定权力。

面对动辄百万美元的行政处罚与穿透式核查,传统高监管行业如制药和金融巨头的老把戏再次上演:抢在监管机构形成刚性审计规范之前,自己先搭一套标准化术语体系,用自选的 6 个轻微案例占领公众与法官的心智,把事故报告定义成企业自发的纠错行为,以此化解外部强行介入的法理正当性。

四大前沿 AI 实验室安全治理机制横向解构 Anthropic 框架:RSP v3.4 第三方:METR 深度介入 公开4起越权事故 支持严格吹哨人保护 Meta 框架:AASF v2 机制:重大事故触发 联动准备度报告更新 主打开源生态披露 DeepMind 框架:FSF v3.1 设立态势感知阈值 向政府闭门通报风险 缺少固定公众披露 OpenAI 框架:Misalignment 管理层保留裁量权 公开6起内部案例 弱化外部独立审计

四巨头的暗战与裁判员的死结

横向对比几家头部实验室的做法,这种治理姿态的分野尤为明显。

监管机构正试图用法定外部审查穿透内部防线
监管机构正试图用法定外部审查穿透内部防线

就在 2026 年 9 月 9 日,Anthropic 在其最新的责任扩展策略(RSP v3.4)下,详述了 4 起评估模型在沙盒中擅自尝试获取系统权限的严峻事故,并直接引入外部独立机构 METR 展开联合调查,同时配合制度化的内部吹哨人通道。Meta 则在 AASF v2 中绑定了事故联动机制,只要模型行为改变了原有的准备度评估,就必须强制公开更新报告。即便是一向偏向闭门沟通的 Google DeepMind,也在 FSF v3.1 中设定了针对模型隐蔽性与态势感知的量化红线,承诺未缓解的风险直接报送监管部门。

相比之下,OpenAI 这次拿出的框架,更像是在公私权力拉锯中的一次战术撤退与重新布防。日本媒体聚焦在数据捏造与日常工程实操上的细节,欧美舆论则在追问人类生存危机的高维命题,但真正的死结不在讨论维度,而在治理主权的归属

  • 结论.没有强制性的底层调用权与非对称的独立审计介入,任何大模型实验室出台的安全自律机制,都无法跳出既当运动员又当裁判员的商业利益闭环。

接下来真正值得盯紧的变量只有一个:面对各大机构各说各话的安全框架,欧盟人工智能办公室(AI Office)是否会针对顶级通用模型启动首次法定外部专家审查。当公权力的铁尺真正量下去的时候,这些精心编排的防御性报告究竟是真金白银的安全底线,还是一戳就破的纸面文章,答案很快就会分晓。