本周的Import AI把两条看着不相关的新闻放在一起:一份政策报告,一篇数学论文。前者告诉你美国政策圈打算怎么应对AI自己造AI(行业里管这叫RSI,研发自动化);后者用博弈论算出一件反直觉的事——两家AI公司要想真的踩下刹车,光靠监控还不够,监控太精确,反而可能让谁都不敢先停。这比"AI竞赛需要透明度"这句常识狠得多,它说的是:药下错了剂量,病会更重。

IFP开出23张药方:先囤筹码,再谈刹车

智库IFP这份报告题目直白——《美国应如何应对日益自动化的AI研发》,给政策制定者列了23条具体建议,归进7大类:给自动化研发建透明度、提升国家理解和响应能力、做兼顾防御与商业的风险管理、加速AI验证技术、投资社会韧性、延长美国AI领先优势、给国际合作留选项。

前几类像是在造仪表盘。现在的AI产业像一辆只有油门、没刹车、也没仪表盘的车,IFP想做的是先把刹车片和转速表装上,免得真到要减速的那一刻,手里一张牌都没有。

但七类里最扎眼的是"延长美国AI领先优势",排位在"国际合作"之前。翻译一下就是:自己先把安全边际做大,再考虑跟谁协调减速。这跟"全球暂停"的主张不是一回事——本质上还是竞赛逻辑,只是把"跑"和"管"打包一起卖。

一道数学题证明:光有监控,谁都不敢先松手

如果说IFP在造工具箱,MIT与哥伦比亚大学那篇《Racing to Ruin》就是在给"减速"这件事本身做体检。研究者建了个简化模型:两家公司竞相把技术往前推,推得越猛,触发"全员清零"式灾难的风险越高——这风险来自研发本身,跟用不用它无关。

模型算出来的东西很反常识:监控越精确,不等于越容易协调停下来。一旦大家能看清对方进度,每家反而更想当"第二个停下"的那个——先停等于先认输,不如等确认对手真停了再跟。双方都在等对方先出牌,这就是僵局。

两种停止博弈 抢先停 赌对手理性 自己先松手 快讯=划算 确认后停 先看对手停 确认后跟停 快讯=想等 中等信任区间:两种赌法互相拆台
  • 风险.信息传得越快,"抢先停"和"等确认"两种策略会同时变得更诱人——这正是中等信任区间最麻烦的地方。

透明度是双刃剑,信任才是那味真正起效的药

论文最后给出的结论近乎冷酷:信任低,所有均衡都会一路竞赛到灾难发生;信任中等,立刻停止和竞赛到底两种结局都可能出现,全看运气;只有信任足够高,两家理性公司永远竞赛下去的概率才会随信任先验的提高快速趋近于零。

信任水平决定结局 低信任 必然竞赛到灾难 中信任 停止与竞赛都可能 高信任 竞赛概率趋近于零
透明度不是万能药,信任才是那味真正起效的药引子

这跟核裁军的老逻辑几乎是一回事——trust, but verify。冷战年代美苏谈判也走过这条路:光有卫星监控没用,得先有"对方不会背刺"的基本判断,监控才是护栏,不是导火索。今天AI公司之间连这层基本互信都还没建立,更谈不上验证机制。

  • 结论.监测机制要么快到能自证,要么干脆别做半吊子,否则等于给竞速的双方发了一副可以互相偷看的后视镜。

现实的牌桌比模型脏得多

论文的模型只有两家公司,现实里AI竞赛从来不是双寡头,而是一堆实验室加几个国家一起下场。模型假设越干净,离真实牌局就越远。IFP把宝押在"美国先跑赢再谈规则",论文却提醒所有人:监测设计得不好,它本身可能就是压垮协调的最后一根稻草。

同一期还配了一篇作家thebes写的虚构短篇,讲一个人去参观由强AI运营的设施,涉及AI暂停、递归自我改进、人该不该信任一台聪明机器。这篇小说不提供新事实,但它把论文里那句冷冰冰的"要能把对方建模为理性行为者",翻译成了一个更直白的人类问题:你愿不愿意把安全交给一个你看不懂决策过程的系统。这恰恰是IFP的清单和论文的公式都没有正面回答的部分。