OpenAI下一代模型Astra还没正式发布,AI安全圈已经先吵起来了。据The Information援引消息源报道,Astra用了一种叫“recurrent depth”(循环深度)或“opaque recurrence”(不透明循环)的推理方式:模型不再像传统思维链那样一步步往下推,而是把同一个查询在循环里反复处理几遍。结果是留下的可读痕迹变少,外界更难看清模型到底是怎么想的。

Redwood Research CEO Buck Shlegeris看完消息直接表态“极度担忧”;长期关注AI安全的Zvi Mowshowitz呼吁可能需要立法,防止各家实验室在这条路上“逐底竞争”。听起来像是一次全行业的集体警报。但把这条新闻往下挖一层,会发现事情没那么简单——这场警报的技术地基,其实相当松动。

Astra到底强在哪,又危险在哪

比“思维链会不会变模糊”更该先弄清楚的是:Astra是个什么级别的模型。OpenAI自己已经把Astra归类为达到“Critical cybersecurity capability”(关键网络安全能力)门槛的系统——在合适的工具和权限下,它能挖掘未知漏洞,针对高强度加固的目标开发攻击手段,甚至有可能在很少人工介入的情况下,从一个高层目标自主拼出完整的攻击链。

这不是小事。今年8月,OpenAI就是因为这个能力评级,主动放慢了Astra的开发节奏。等到9月这套“循环推理”的消息一出来,外界的紧张感自然会被放大——一个网络安全能力被自评为“关键级”的模型,如果连思维链监控这个最后的可见窗口都变模糊,风险感知会被迅速拉高。

OpenAI给出的应对是把监控范围扩大到Astra所有涉及工具调用的推理,不只是训练和评估阶段。代价是清楚写在文档里的:这套全量监控大约要多花被监控推理算力的20%。这笔额外开销本身就说明,公司内部并不认为这件事可以靠一句公关声明糊弄过去。

Astra已知的三个硬数字 Critical 网络安全能力分级 8月一度被 主动推迟开发 ~20% 全量CoT监控 额外算力开销 覆盖所有 工具调用推理 2倍 计算图深度 相较GPT-4 Pachocki给出的 唯一量化反驳

OpenAI的回应,安慰还是回避

OpenAI首席科学家Jakub Pachocki在X上回应,强调公司“从第一代推理模型起就在努力保留和利用CoT监控”,并否认Astra在往“neuralese”——彻底在潜空间里推理——这条路上走。他给出的具体论据是:包括Astra在内的当前前沿模型,计算图深度大致在GPT-4的两倍以内。

这句话是这场争论里少见的可验证信息,也确实比一句空洞的“我们重视安全”有分量。但它同时暴露了争论真正卡住的地方:外界担心的从来不是Astra现在有多不透明,而是这套循环机制将来能被放大到什么程度。Pachocki自己也承认,模型的可监控性总体上是脆弱且在下降的——这句话本身就是一句有保留的安慰,不是彻底否定风险。

值得放慢一步看的是,整条新闻链条里,“opaque recurrence”和“recurrent depth”这两个词,从未出现在OpenAI公开发布的Astra技术文档里。所有细节都来自The Information援引的匿名信源。这不代表报道不实,但意味着眼下的行业讨论,很大程度上是建立在二级信源之上的——这一点原文完全没有交代。

安全社区没有原文暗示的那么一致

原文的叙事容易让人觉得,AI安全专家“集体震惊”。实际情况更接近意见分裂,而不是同一个调门。

Shlegeris和Mowshowitz的担忧是制度性的:他们担心的是OpenAI如果把这套循环推理进一步放大,会彻底摧毁CoT监控这个行业最依赖的对齐工具,Mowshowitz甚至提出可能需要立法来防止逐底竞争。

但Redwood Research首席科学家Ryan Greenblatt的立场明显更谨慎。他公开表示,在拿到更精确的技术细节——比如Astra实际的循环迭代次数、这个次数是否容易被放大、放大之后性能提升有多大——之前,他不认为可以断言这是一次监控能力上的重大突破。他真正担心的是一个更长远的“自然演化路径”:如果这项技术持续扩展下去,模型可能几乎完全在潜空间里推理,彻底脱离任何可见的监督渠道。

警报和存疑,本身就是同一套风险认知的两种表达方式

这种分裂不是坏事,恰恰是安全领域正常运转的样子——先示警,再要证据,两者并不矛盾。


The Information后续报道称,AnthropicGoogle DeepMind也在讨论类似技术。这里有个容易被绕进去的名字陷阱:Google确实有一款叫“Project Astra”的产品,但那是一款多模态实时助手,跟OpenAI这款同名的Astra模型是两件完全不同的东西,读者刷到相关讨论时容易张冠李戴。

  • 风险.如果Anthropic、Google DeepMind真的在跟进类似的循环推理架构,行业里“尽量维持CoT可读性”这条非正式默契就已经出现裂缝,而不是仍然完好。

对普通用户而言,Astra短期内不会开放给大众——它先要在有限测试者范围内验证网络安全能力的可控性。真正该盯的是接下来几周:Anthropic和Google DeepMind会不会在系统卡或官方声明里正面回应这项技术,以及OpenAI在Astra正式发布时,会不会拿出比“计算图深度是GPT-4两倍”更扎实的证据,来证明思维链监控依然有效。