Jakub Pachocki这句话乍看很稳:要防住其他AI带来的危险,需要更强、更对齐的AI来守基础设施、盯失控智能体、发明新的防护手段。这是OpenAI首席科学家在长文《An Alien Mind》里给出的表态,发布于9月6日,"Scalable defense"是其中一节的标题。
单看这段引言,像是一句常规的安全公关。但把它放回全文语境,味道完全变了。
一篇比引言激进得多的长文
《An Alien Mind》的核心判断不是"我们很谨慎",而是前沿AI的能力和自主性增长速度,已经超过了研究者理解、对齐、监控它们的速度。文章直言,没有任何一家实验室已经把这个问题解决到可以放心持续全速扩展模型的程度。
这是一句相当罕见的坦白。行业里公开承认"我们的安全能力落后于模型能力"的表态不多,尤其出自一家正在冲刺前沿的实验室首席科学家。
紧接着,文章给出的解法却是:继续训练更强的模型,用来防御其他AI的威胁,这将是OpenAI部署工作的主要方向。公司已经把这个逻辑用在网络安全上——受限访问的防御系统负责漏洞发现、代码审查、事件响应和补丁验证。
防御性加速:合理的说法,闭环的逻辑
"用更强AI防御AI"这句话的问题不在于错,而在于它几乎无法被反驳。
对手领先时,可以说必须加速,才能守住防线;对手放缓时,可以说这正是安全构建防御系统的窗口期。几乎任何竞争格局,都能被这套话术解释成"继续扩展"的理由。
更麻烦的是,防御能力和进攻能力往往是同一种能力。能发现系统漏洞的模型,同样能被用来制造漏洞;能说服人的模型,防御场景和诈骗场景用的是同一套本事。访问控制能挡住一部分滥用,但挡不住模型被窃取、被越狱、被内部人员滥用的风险。
- 风险."防御性加速"没有给出具体阈值、没有说明谁有权喊停、也没回答竞争对手拒绝配合时OpenAI会怎么做。
谁来当裁判
更值得留意的是一个技术性细节:OpenAI现有的Preparedness Framework里,有一条允许公司在另一家前沿开发者发布未采取同等安全措施的高风险系统时,重新考虑自己的部分安全要求——前提是调整后仍要"更具保护性"、不明显增加整体风险。
这条条款和《An Alien Mind》里"不惜代价推进是荒谬的"的表态,摆在一起有点尴尬。一边说竞争压力不能成为放松的理由,一边在制度文本里给"竞争对手降标就可以跟着降标"留了口子。
制造危险的机构,同时也是评估危险、裁定安全是否够、运营防御方案的那个机构
这不是OpenAI一家的独有问题。Anthropic的负责任扩展政策、Google DeepMind的Frontier Safety Framework、Meta的Advanced AI Scaling Framework,都是同一类尝试——自愿设定能力阈值和安全护栏,由公司自己管理。区别只在细节的具体程度:Anthropic的RSP写了逐级AI安全等级、风险报告、董事会介入和外部审查条款,比《An Alien Mind》里的建议更成文;但本质上,所有这些框架都缺一个环节——一个有强制力、能真正下令暂停的外部机构。
三派反应,一个悬而未决的问题
早期的讨论大致分成三种声音:安全派把这篇文章看作行业罕见的坦白,承认能力已经跑到监控和对齐前面;怀疑派认为这更像声誉管理和监管布局,顺手把现有优势包装成安全叙事;加速主义和国家安全派则认同防御逻辑本身,但强调单边放缓在对手可能继续推进的情况下并不稳定。
三种立场都没错,只是指向了同一个空白:共同安全阈值谁来定,独立审计谁来做,强制力从哪里来。这几个问题《An Alien Mind》没有给出可执行的答案,而这恰恰是判断"防御性加速"是真安全策略还是新加速借口的分水岭。递归式自我改进的预期,文章说依据的是内部结果,外部目前无法验证——这也是接下来最该盯的一个变量:这些内部结论会不会被拿出来接受检验,还是永远停留在"我们知道,你们信就好"。
