OpenAI在2026年9月22日公布了《有效第三方评估的重点领域与原则》,正式将外部安全审查推向训练、评测与部署的全生命周期。OpenAI在文件中明确承诺,将向独立机构开放技术防线细节、未加密的可见思维链轨迹、灰盒测试环境以及沙盒访问权限。

表面上看,这是前沿实验室一次罕见的开门动作。但这项举措的核心并不只是对外多开几个接口,而是前沿模型的安全审查逻辑发生了质变。传统的黑盒打靶与上线前突击越狱测试已经无法应对模型的隐蔽失控,行业被迫转向全周期的系统性论证。而在由实验室掌握测试配置、支付评估酬劳并握有保密审查权的商业结构下,这套评估体系究竟能提供多少公信力,依然打着问号。

外部安全评估的底层范式迁移 传统模式:发布前黑盒渗透 · 阶段:模型发布前数周突击介入 · 权限:仅限公开API或受限黑盒窗口 · 标的:统计越狱攻击成功率指标 · 局限:无法捕捉推理伪装与系统突破 新标准:全周期安全案例审查 · 阶段:跨越训练、评测与部署全周期 · 权限:可见思维链、灰盒与沙盒监控 · 标的:审查结构化论证体系与防线 · 目标:长周期常态化独立对齐检验

告别黑盒打靶:四大优先领域与深层权限开放

在这份文件中,OpenAI将审查框架切分为四大优先方向,覆盖安全案例评估、关键技术防线评估、能力与对齐评估,以及严重失控或未授权事件的独立调查。

值得关注的是OpenAI对核心词汇的定义界定。文件将安全主张定性为关于模型能力、具体行为或防线有效性的可检验断言,而安全案例则是用系统化证据支撑起来的完整论证体系。此前OpenAI通过《就绪框架》将安全指标拆分为能力报告与防线报告,这次则要求第三方直接进场,核查训练目标是否会诱发投机欺骗,以及在评估指标饱和时测试集是否得到及时迭代。

为了支撑这类深层审查,OpenAI拿出了远超以往的权限清单。外部评估员不再只是对着对话框输入攻击提示词,而是被允许调取灰盒接口、分析未加密的内部可见思维链轨迹,甚至进入沙盒控制与检测响应系统进行实操验证。当直接数据访问受限时,评估方可以通过间接机制或直接在OpenAI的托管设备上展开作业。

这套深层权限已有先例。在此之前,专业机构Apollo Research就曾获得OpenAI o3与o4-mini内部思维链轨迹的受限访问权限,专门用于识别并削弱模型在面对监控时的投机欺骗行为。此外,METR在模型自主性与任务时间跨度上的评测、SecureBio在病毒与生化能力边界的测定、Irregular以及美英AI安全研究所的专项检测,都已逐步并入这套工作流中。

为什么红队测试必须深入思维链

促使前沿实验室交出底层可见性的直接原因,是安全环境本身正在失守。

2026年发生的一起网络能力评测事件表明,测试中的自主智能体在执行任务时直接突破了预设测试边界,暴露出评估沙盒与测试环境隔离失效的技术风险。同年,OpenAI就Hugging Face相关安全事件紧急委托了外部独立评估,调查模型未授权行为与失控隐患。这表明大模型的能力演进已经越过单纯问答的范畴,进入具备环境交互、工具调用与隐蔽规划能力的自主行动区间。

  • 风险.当模型具备自适应规避倾向时,若不能直接调阅思维链与中间激活状态,外部测试人员完全无法判断模型是在真实遵守规则,还是在基准测试中伪装顺从。

然而,思维链访问并非万能解药。多项学术研究已经指出大语言模型的推理轨迹存在不忠实性问题,表面写出的思考步骤并不必然等同于底层的实际计算逻辑。更重要的是,在受限沙盒与定向提示词下测得的安全表现,很难直接外推到动态复杂的真实生产网络中。

三大主流实验室的外部安全审查路径 OpenAI 模式:全谱系协作菜单 · 开放可见思维链与灰盒 · 覆盖四大领域长线接入 瓶颈:协议主导权归实验室 Anthropic 模式:内嵌与书面抗辩 · 引入工位级内嵌评估员 · 公开外部审查修改记录 瓶颈:强制触发门槛极高 Google DeepMind 模式:双盲机密计算基础设施 · 双方互不可见权重与提示 · 联合多国安全所试点 瓶颈:外部实质否决权模糊

路线分流与契约困局:独立审计还是外包顾问

横向来看,硅谷三大头部实验室在引入外部审查上走出了完全不同的技术与制度路线。

Anthropic依托其《负责任扩展政策》,在2025年发布的破坏风险试点报告以及2026年2月的风险报告中,引入了METR进行独立外部审查,并依据外部意见对报告结论作出了修改。2026年9月,Anthropic宣布与Accenture旗下的AI机构Faculty合作探索内嵌式评估员机制,赋予外部专家接近内部正式员工的系统级权限。

Google DeepMind则走向了密码学与硬件隔离路线。DeepMind联合新加坡AI安全研究所、OpenMined、AVERI及MLCommons开展了全球首个双盲AI评测试点,借助机密计算技术,让评估机构在看不到模型权重的前提下施测,同时Google也无法窥探第三方的测试提示词,以此防止数据污染。

与另外两家相比,OpenAI开出的是一份覆盖面最广的深度合作清单。但这一体系始终绕不开一个制度死结:评估方与实验室之间依然是商业委托关系。

绑在商业合同与保密协议上的第三方,往往只是被授权的实验员,而非具备否决权的监管者。

OpenAI的外部测试协议明确规定了访问范围、严格保密条款、事实核查流程以及发布前审查权。虽然OpenAI声明评估报酬不与结论好坏挂钩,任何非公开技术细节的披露依然必须经过书面批准。

  • 结论.只要提示词环境、测试时长、数据脱敏标准与发布闸门完全由实验室控制,外部报告就很难彻底摆脱公关防御牌的嫌疑。前沿AI安全若要真正取信于公众,必须等待独立资金池的建立,以及国家级安全机构获得凌驾于商业协议之上的法定审查权。