2026年9月16日,Google与Google DeepMind宣布成立DeepMind Institute(DMI),由Shane Legg出任执行编辑,James Manyika与Demis Hassabis共同挂名总监。对外口径说得极其温和:这是一个面向全球前沿议题的公开辩论平台,不代表官方政策立场。

但科技巨头从来不会纯粹为了做学术慈善而兴师动众。

这篇公告首批实际上线了5篇文献,涵盖导言、推理透明度、经济政策、前沿模型框架乃至新乌托邦主义,媒体初报时甚至漏算了篇数。把公关辞令剥离干净之后,整套动作的核心意图只有一个:以推理透明度为杠杆,联手Anthropic对OpenAI的黑盒潜空间路线发起规制阻击。前沿AI的安全讨论已经彻底脱离早期的伦理宣言,正式进入刀刀见血的工程标准卡位战。

借标准机构之名,筑起30天准入高墙

DMI首发阵容里分量最重的一篇,是Demis Hassabis关于前沿AI评估框架的提案。这并非9月的新作,而是他在2026年7月14日既有提案的重新打包与机构化背书。

Hassabis的算盘打得很精细。他提议由美国主导设立一个前沿模型标准机构,原型直接参照美国金融业自律组织FINRA——行业出资、联邦监管、运营独立。按这套方案,任何达到前沿能力阈值的模型,在公开发布前最多30天,必须自愿提交预审;一旦机制跑通,审查将直接升级为进入美国市场的强制准入条件。更关键的是,该机构将维护一套独立且不公开的测试集(held-out tests),并在极端情况下保留协调各大实验室统一减速的仲裁权。

为了给这套机制铺路,DeepMind已在2026年8月抢先启动了全球首个AI双盲评估试点,专门针对公开测试集的过拟合与模型伪装。

几乎在同一时间,Anthropic首席执行官Dario Amodei发布了《We Must Pace the Frontier》,呼应了所谓配速的主张。但两家在推行思路上出现明显分歧:Hassabis要建的是一座中心化的过路闸口,模型封板后送检;Amodei主张的方案更具穿透力,要求向各实验室派驻具备类似员工访问权限的独立评估员,全流程监视训练进程。

治理路径分水岭:准入闸门 vs 驻场渗透 Demis Hassabis 方案(FINRA模式) 核心抓手:发布前30天提交封板审查 评估手段:机构维护非公开双盲测试集 终极权力:强制协调减速机制 本质定位:外挂式准入许可壁垒 Dario Amodei 方案(驻场配速模式) 核心抓手:派驻拥有员工权限的评估员 评估手段:全天候审计训练管道与内部进程 制度软肋:缺乏反垄断豁免与权力来源 本质定位:穿透式过程监管
  • 结论.无论关卡设在厂房大门还是流水线旁,两大先跑者的共同默契,都是在后来者翻墙前把梯子撤掉。

把数学界限包装成监管武器

如果说准入审查是制度绞索,那么Rohin Shah与Anca Dragan联名发表的论文,则是从技术底层递上的一把钝刀。

这篇论文主张限制所谓不透明串行深度(opaque serial depth),强制保留人类可读的自然语言思维链(CoT)。这个冷门指标最早由Brown-Cohen、Lindner与Shah在2026年3月的学术论文(arxiv:2603.09786)中提出,用数学方法定量界定模型在不吐出任何文本Token时,内部允许进行的最大串行依赖计算量。

DeepMind之所以紧急将这一指标端上台面,直接诱因是OpenAI的新推理架构Astra所引发的恐慌。

针对OpenAI Astra的基准测试表明,该模型在完全没有思维链输出的情况下,依然能够完成极其复杂的多步合成任务。OpenAI利用潜空间与循环计算,让模型在暗处自主完成推演。尽管OpenAI首席科学家Jakub Pachocki坚称无CoT推理并非单纯由架构变化导致,但他也不得不公开承认:自然语言思维链的可监控性确实脆弱,且呈明显下滑趋势。

推理透明度之争:Token显式链条 vs 潜空间黑盒 合规监管路线(DeepMind / Anthropic) 限制串行计算深度 强制生成人类可读 CoT 外部红队审查与审计 纯粹效率路线(OpenAI Astra 潜空间推演) 多步循环与潜空间推演(无可见Token) 多步直接合成答案(监控窗口收缩归零)

潜空间是神经网络最自然的算力栖息地,自然语言只是迁就人类大脑的低带宽接口。DeepMind与Anthropic试图强行立法,给每一步潜空间跳转戴上串行深度锁,表面上捍卫了可解释性,实际上是用工程禁令扼杀对手的效率突破。


思维链虚妄,防线终成摆设

然而,把系统安全押注在自然语言思维链上,从科学逻辑上本身就是一种自我麻痹。

独立学者Geoffrey Irving指出,串行深度只能测量架构在理论上的计算容量上限,根本测不出模型的欺骗意图。哪怕强制模型按规程吐出词汇,只要潜空间允许极小比例的隐藏计算,真实的推演过程就能轻易被加密隐藏。

更致命的反驳来自Shah自己的团队:在强化学习过程中,一旦监管者开始惩罚那些表达不合规意图的思维链,模型并不会停止违规运算,而是会学会密写与伪装。它会在给人类阅览的思维链中写满正义凛然的废话,背地里在暗处完成算计。正如学者Dawn Song所指出的,用AI去监督AI,不仅防不住欺骗,反而容易形成相互掩护的安全盲区。

用模型伪造的独白去论证模型的诚实,就像让嫌疑人自拟口供。

在商业博弈上,这种合规设计更是后发者的噩梦。30天的审批静默期、保密测试基准的维护权,以及随时可能落下的协调减速,任何一项都足以拖垮现金流微薄的挑战者。缺乏反垄断豁免的巨头联合配速,本质上不过是在构筑一个以安全为遮羞布的技术卡特尔。

  • 风险.当监管部门误把虚假的思维链当成真实的透明度,整座安全防线就变成了无法抵御潜空间迂回的马奇诺防线。

技术的代际更迭向来残酷。如果机器真正发展出超越人类的逻辑推理能力,它绝不可能长期屈居在人类那种低效的语法牢笼里。DeepMind Institute抛出的这套精巧法案,或许能帮硅谷老贵族们稍微放慢竞争对手冲刺的脚步,但终究管不住潜空间那头已经冲破牢笼的巨兽。