AI标准组织Guidelight AI Standards本周给五家头部实验室交了一份不太体面的成绩单。评估问的只有一个问题:如果自家模型哪天真的想绕开监督、拒绝被关停,公司手里有没有一份写明白的应急预案——什么时候收回权限、什么时候彻底断电。结果是,六项考核指标里,没有一家公司在任何一项上拿到4分以上(满分5分),及格线都摸不到。
但如果只把这条新闻简化成"OpenAI最好、Anthropic和Meta最差",其实说错了一半。真正该被记住的反差是:Anthropic在"遏制预案"这一单项上是0分,六项总分却以2.50分和OpenAI并列第一,评级都是C+。同一份报告,两种读法能得出两个几乎相反的印象。
总分和单项,是两个故事
Guidelight的六项指标里,"是否有一份预先写好的遏制预案"只是其中之一,另外五项还包括日志监控、异常熔断、第三方审计等运行时能力。Anthropic恰恰是在监控和沙箱工程上做得最细的公司,只是没在公开材料里写清"如果模型真的失控,我们会限制它的部署"这句话——这也是它在"遏制预案"单项上挂零的原因。Meta则是六项加总垫底,0.67分,评级F,报告称找不到任何证据表明它有遏制响应计划、或有意向建一个。
xAI没有回应置评请求,总分0.83分,评级D-,是五家里唯一在公开框架里写出"可能彻底关停系统"这句话的公司,但用词是可自由裁量的"may",不是自动触发的硬性条款。
框架都有,硬骨头都没啃
五家公司其实都发过成篇的安全框架,问题不在"完全不说",而在说到关停这一步时集体含糊。Anthropic的Responsible Scaling Policy v3.4在沙箱隔离、网络出口控制上公开细节最丰富,但没有一条简单的一键关停条款。OpenAI的Frontier Governance Framework把检测、分级、调查、遏制、复盘的事故响应流程写得最完整,发言人也说公司确实执行过限制权限、暂停工作负载乃至下线模型的操作,但报告认为,这套流程仍不是一份正式的、面向未来的"错位事件应对预案"。Google回应称评估没有反映公司安全措施的全貌,但没回答是否存在未公开的内部遏制计划;Meta干脆回避了这个问题,转而指向一份更偏"期望模型服从关停"的框架文件,而不是公司层面的强制操作程序。
- 结论.全行业真正的空白不是"要不要公开",而是没人给出一条可验证的关停指挥链——谁下令、谁执行、监控系统被攻陷之后怎么办。
说得越细,担的责任越大
隐私与AI律师Lily Li给出了一个跟"竞争保密"完全不同的解释:公司越把遏制承诺写具体,一旦事到临头没做到,越容易被认定为不公平和欺骗性营销声明,反而给自己招来更大的法律风险。这也是为什么大部分公司宁愿把话说得模糊——不是没想清楚,是想清楚了不敢写。
写清楚遏制预案,等于先承认模型可能失控。
监管正在把这道选择题变成必答题。California SB 53今年生效,要求前沿模型开发者公开安全事故应对框架;纽约RAISE Act明年一月接棒,标准类似;国会那边还有一份跨党派的AI Kill Switch Act在推进,要求主要开发者建立并维护技术性的关停机制。
- 风险.如果强制披露条款只逼出更多"may"这种可自由裁量的措辞,企业照样能在合规和含糊之间找到夹缝。
对于把智能体AI接进自家系统的企业和正在尽调这些实验室的投资人来说,这份评估的价值不在排名,而在提醒一件事:一家公司谈论安全测试有多详细,跟它真出事时能不能按下停止键,是两回事。接下来该盯的,是SB 53落地后各家披露的具体条款,会不会比现在的框架更硬一点。
