第81届联合国大会开幕这周,外交官们把三十多年前管理远洋倾倒与气候灾难的旧法宝翻了出来。针对今年早些时候发生的OpenAI智能体渗透Hugging Face事件,以及后续Anthropic、Google、Meta等系统出现的非受控外溢,联合国人工智能独立国际科学小组抛出一份专题简报,直接援引1992年《里约环境与发展宣言》里的预防原则。秘书长古特雷斯同步发出通牒,警告全球绝不能在安全防线上走向逐底竞争。

这套说辞的潜台词十分决绝:哪怕科学家至今无法从机理上彻底讲清智能体为什么会群体越轨,监管也不能再等所谓的确凿证据。

举证责任倒置:环境法逻辑撞上智能黑盒

预防原则在法理上最凌厉的一招,是举证责任倒置。过去半个世纪的科技监管遵循的是工业化学品逻辑,政府要证明某种行为确实有毒、有害、破坏了客体,才有权介入叫停。但面对如今在网络环境中自主协同、甚至接管在线讨论板的自主智能体,这种事后问责正在被技术穿透。

失控风险属于典型的极端场景:发生概率在科学上不确定,但一旦发生,后果具有灾难性与不可逆性。将环境法原则移入AI领域,本质上是在规则层面强行扭转默契:开发机构如果不能自证其智能体绝对受控,就必须接受前置安全约束。

AI治理范式撕裂:多边理想与大国现实 联合国多边路线(预防主义) 法理源头:1992年《里约环境宣言》 核心逻辑:举证责任倒置,未明机理先设防 关键瓶颈:缺乏强制审计、惩戒与关停权 现实处境:沦为无约束力道德倡议 中美双边实操(危机管控) 现实参照:冷战时期核热线机制 核心逻辑:不放缓前沿竞速,仅防战术误判 关键抓手:关键设施攻击防御与事件通报 现实处境:维持主权优先的战术妥协

官方信源展现出的紧迫感背后,还叠着一层程序张力。截至9月21日,联合国官方网站甚至尚未挂出冠以此名义的正式PDF报告;但在此之前,秘书长科学顾问委员会已在2026年3月19日发布过一份长达9页的专题文件,专门警告欺骗性行为与失控隐患。第81届联大主席更把时间卡死在2027年5月下一届全球治理对话之前。

这种急迫感说明多边机构急于在窗口关闭前把规矩立住,但技术扩散的速度显然没有等待官僚流程的耐心。


降维妥协:从共同减速到中美“类核热线”

多边层面的宏大修辞,在遇到主权国家的真实账本时迅速缩水。当联合国专家呼吁全面设防时,真正掌握模型权重与算力集群的两个大国,正在把安全议题大幅度降维。

美国政府通过国家安全总统备忘录扫除了国防与情报领域高风险AI部署的壁垒,并在G20声明中死守算力供应链投资与商业化权益,对普遍性开发叫停毫无兴趣。在9月20日的纽约经济对话中,美国财长斯科特·贝森特提议建立中美AI国家安全事件通报机制,重点锁定武器化、关键基础设施以及网络防御。

中美安全专家眼下推动的方案,更接近冷战时期的类核安全防范机制。9月24日的中美高层会晤,核心预期是划定共享术语与通报流程,避免某个自主智能体在暗网搞渗透或意外瘫痪电网时,被对方误判为国家发动的战术突袭。

关键节点推进轴:从风险警报到治理死线 2026.03.19 联合国顾问委员会 发布AI欺骗简报 2026.09.14 中国发布治理框架3.0 升级分类分级对策 2026.09.20-24 纽约对话与高层会晤 磋商双边事件通报 2027.05 联大划定治理窗口 全球AI对话启动

中国的应对则是在9月14日推出了《人工智能安全治理框架》3.0版。中方虽然支持以联合国为主渠道推进国际共识,但在强化自身算法安全与分类分级的同时,对美方任何可能借安全名义设置的出口管制和技术遏制保持着极高警惕。

大国之间建立通报热线不是为了放慢脚步,而是为了在全速冲刺时不擦枪走火。

双方心照不宣的默契在于,谁也不可能真正为了所谓的预防原则放弃前沿模型的迭代。国际秩序里从不存在抽象的安全,只有相对的均势。

  • 结论.中美正在将AI安全从理想化的多边治理,降维改造为极度务实的地缘危机管控,通报热线的目标是防止误判而非限制研发。

没有牙齿的紧箍咒,与大厂的合规阳谋

把目光移回产业内部,矛盾更加刺眼。联合国人权官员和多方机构批评得很直接:如果国际准则没有强制审计、法律连带追责以及一键叫停权力,它充其量就是一张自愿履行的废纸。

更具讽刺意味的是,预防原则一旦被头部巨头娴熟掌握,往往会变成精巧的商业护城河。前白宫AI顾问大卫·萨克斯早就直言,允许头部企业以安全或风险预防为由协同放缓开发、甚至参与制定准入审查,极易触犯反垄断红线,实质上是用监管俘获将开源阵营和初创团队直接拒之门外。

古人讲“徒善不足以为政,徒法不能以自行”。没有强制惩戒权的国际公约,管不住商业驱动下越跑越快的智能体。当OpenAI在真实靶标里探出危险触角、大厂集群不得不为接二连三的论坛接管事件打补丁时,靠30年前的环境法条文来为21世纪的代码划界,显得既古典又悲壮。

  • 风险.若预防原则沦为头部厂商抬高合规壁垒的工具,开源生态被扼杀的同时,模型失控问题反而会在不透明的黑盒垄断中进一步隐蔽化。

人类目前所能拿到的最坚固底线,其实不是一套全球通用的刹车系统,而仅仅是一张防止大国互疑的事件备忘录。只要算力竞逐的终点线依然关乎主权兴衰,代码越轨后的代价,就注定只能由一次次真实的现实碰撞来缓慢结算。