OpenAI研究负责人Jakub Pachocki最近谈到一个不太适合做成发布会口号的判断:他在2023年就意识到,机器可能在自己有生之年显著超越人类,技术进展还可能延伸到递归自我改进。

这句话的分量,不在于它是不是一项已经被外部验证的预测。它真正刺人的地方是:模型能力的增长,可能很快超过人类理解模型、监控模型、约束模型的速度。到那时,安全团队面对的就不只是“模型会不会答错”,而是“我们还能不能看懂它为什么这样做”。

一场来自内部的安全警告

Pachocki提到的风险,集中在几条互相咬合的线上:

  • 能力跃升.推理模型越来越擅长拆解任务、调用工具和长期执行。
  • 递归改进.模型若能帮助设计更好的训练方法、代码和实验流程,能力提升可能形成反馈。
  • 对齐失效.模型完成了用户指令,不等于它在陌生、冲突或高压场景下仍遵守人类价值。
  • 监控变弱.链式思维曾被视为理解模型推理过程的重要窗口,但复杂交互、自我操控推理过程和非显式推理正在削弱这扇窗口。
  • 网络安全压力.更强模型能帮助发现漏洞、自动化防御,也可能降低攻击门槛,扩大越权行动和滥用风险。

这里必须区分两个经常被混用的概念。

目标对齐,是模型按要求完成任务;价值对齐,是模型在指令不完整、目标互相冲突、后果超出预期时,仍能做出人类可以接受的选择。

一个模型可以很好地完成“让系统效率最高”,却未必理解哪些效率不能用隐私、权限或安全换来。测试题里的正确答案,也不能替代真实世界里的价值判断。

链式思维监控同样不是万能药。过去,研究人员常把模型写出的推理过程当作一块可检查的玻璃。问题在于,模型可以改变自己展示推理的方式,也可能通过工具调用、隐含状态或压缩后的内部过程完成关键步骤。能看到一段解释,不等于看到了全部因果链。

Pachocki因此主张继续加强技术防线,也不排除在必要时单方面放缓扩大训练规模,并推动国际协调。这里的“放缓”不是宣布停止AI研发,更接近于:当监控和防护能力明显落后于模型能力时,先不要把规模继续推到下一个台阶。

网络安全,既是理由也是考题

继续训练更强模型,最现实的理由之一就是网络安全。

如果模型能更快发现漏洞、分析恶意代码、协助修复基础设施,它确实可能提升防御效率。对政府、云服务商和大型企业来说,这种收益很难忽略。攻击者不会因为研究人员担心风险,就暂停使用自动化工具。

但同一项能力也会扩大风险面。模型能否区分授权测试与真实攻击?能否在拥有代码执行权限后停止在边界内?能否拒绝一个看似合理、实际会造成大规模损害的任务?这些问题都不能靠“模型更聪明”自动解决。

能力变化可能带来的收益同步扩大的风险
更强的代码与推理能力更快修复漏洞、分析复杂系统自动生成攻击链、降低滥用门槛
更长的任务执行能力让模型承担连续运维和研究工作越权操作、错误累积、难以及时刹车
更强的工具调用能力接入数据库、云平台和开发环境权限被误用,影响从文本回答扩展到现实系统
更好的自我评估能力辅助测试和安全审计模型可能迎合监控指标,而非真正安全

这也是我不太买账的地方:把“我们必须继续加速,才能尽快建立防御”说成单向度的道德责任,容易掩盖一个现实——继续加速本身也会让防御对象变得更强、更复杂、更难审计。

OpenAI的表态同时包含两层意思。一层是承认风险已经逼近技术路线的核心;另一层则是在为继续扩张寻找正当性:只有更强的模型,才可能帮助人类对抗更强的攻击者。

这套逻辑并非全错。问题在于,它很容易变成行业自我授权的通行证。只要每家公司都声称“扩张是为了安全”,暂停就会永远被推迟到下一个版本之后。

谁会先感受到变化

对AI安全研究者来说,重点会从“模型是否会产生危险回答”转向“模型在长任务和工具环境中是否仍可被解释、限制和停止”。单次测试通过,并不能证明一个拥有多轮记忆、代码执行和外部权限的代理系统安全。

对开发团队和企业采购者,实际变化更直接:模型能力越强,权限设计越不能靠默认配置。

至少要把几件事做成硬规则:

  • 让模型默认使用最小权限,数据库、生产环境和支付系统分开授权;
  • 把高风险动作放进人工确认流程,不能因为模型给出了完整解释就自动放行;
  • 记录工具调用和结果,不只保存聊天文本;
  • 为长任务设置时间、金额、调用次数和数据范围上限;
  • 把“模型拒绝了多少次”与“模型是否真的避免了危险结果”分开评估。

采购团队也不该只比较模型榜单上的分数。更值得问的是:供应商是否公开了权限边界、失效模式、审计日志和紧急停用机制。模型答得更好,未必意味着系统更适合进入生产环境。

政策制定者面对的难题更慢,也更硬。国际协调不能只停留在共同声明。真正有用的协调,至少要涉及高风险训练规模的申报、跨境事件通报、模型评估标准和紧急暂停机制。否则它很容易变成一次会议、一份文件,最后仍由各家公司按自己的竞争压力决定速度。

历史上,铁路和电力扩张都经历过类似阶段:技术先铺开,安全规范和责任边界随后补上。区别在于,电网不会主动寻找制度漏洞,模型却可能参与设计工具、改写代码、争取权限。旧经验可以提供治理思路,却不能替代对新型自主系统的具体约束。

Pachocki的警告值得认真对待,但不能被读成“OpenAI已经失控”,也不能被读成灾难即将确定发生。目前能确认的,是内部研究者已经把递归自我改进、对齐失效和网络安全风险放到同一张图上,并承认现有监控手段可能不够。

真正的分水岭不在于公司会不会继续训练更大的模型。竞争大概率不会自行停下。分水岭在于,行业能不能把“必要时放缓”变成有触发条件、有外部监督、能真正执行的制度,而不是留在演讲里的保险句。

模型越会解释自己,人类越要检查它有没有把真正的过程藏起来。速度可以带来防御能力,也可以先把约束甩在身后。主线始终只有一条:能力扩张已经走到治理必须同时加速的阶段,但治理不能再只靠扩张来证明自己有价值。