AI 领域每逢冠上 RSI(递归自我提升)字眼的论文,总会引发某种超级智能即将闭环繁殖的群体幻觉。2026 年 9 月 14 日,来自 Google、Google DeepMind、马里兰大学帕克分校与弗吉尼亚大学的 Tong Zheng 等 17 位作者在 arXiv 提交预印本论文《Dream-RSI: Recursive Self-Improvement through Evolving Worlds》(arXiv:2609.14858),很快被传为 DeepMind 实现了探索开销暴降 162 倍的自我进化系统;但只要翻开正文就会发现,底层模型的智力分毫未动,这本质上是一套高明的搜索调度器工程优化。

所谓自我提升,在 Dream-RSI 的设计里被严格限制在元搜索策略层。系统既没有改动大语言模型的权重,也没有改动外部评估环境,而是给底层的代码 Agent 套上一层轻量编排机制,把以往搜索过程中丢弃的历史探索树回收建构为回放模拟器;控制器在离线模拟器里做梦演练,评估如何剪枝、并行或提前停止,从而换取低成本策略更新。

Dream-RSI 双环运作机制:在线探索与离线回放 1. 在线代码探索 • 底层模型生成代码 • 外部环境运行评估 • 沉淀多分支历史探索树 生成开销高昂 / 真实评估 2. 离线模拟做梦 • 历史探索树建构模拟器 • 离线回放评估候选策略 • 零真实调用获取即时反馈 纯离线重排 / 零额外调用 3. 策略重写迭代 • LLM重写分支与停止规则 • 部署新策略进下一轮在线 • 持续扩充历史模拟器池 更新调度逻辑 / 循环自提升

挤出宣传水分后的真实战绩

在评估这套调度框架时,最扎眼的数字无疑是论文摘要中给出的调用降幅,但这里的统计口径存在明显反差。论文宣传的调用减少 162 倍,是拿自身基于 Gemini 运行的 317 次调用,去横向比对 SimpleTES 在 Lasso 正则化路径问题上的 51,200 次生成;两者的底层基座模型与具体配置完全不同,算不上严格控制变量的基准较量。

论文宣称的百倍降幅实为跨基座错位对比,同台实测仅缩减四成(示意图)
论文宣称的百倍降幅实为跨基座错位对比,同台实测仅缩减四成(示意图)

更客观的参照物是该框架与自身固定策略基线的同台对比。在 Lasso 的 6 个保留测试集上,以 Gemini-3.1-Pro 为底座时,Dream-RSI 平均耗时 2,931.0 ms,调用 317 次探索 Agent;固定探索基线则耗时 3,587.1 ms,调用达到 550次。切换至 Gemini-3.7-Flash 时,Dream-RSI 耗时 2,350.6 ms、调用 1,879 次,依然优于固定基线的 2,516.7 ms 与 3,200次 调用。调用次数确实砍掉三到四成,性能略有提升,但绝不是跨数量级的神迹。

评测任务与场景Dream-RSI 指标固定基线 / 对照组指标变化幅度与实际判定
Lasso (Gemini-3.1-Pro)耗时 2,931.0 ms / 317次调用耗时 3,587.1 ms / 550 次调用耗时降 18.3%,调用少 42.4%
Lasso (Gemini-3.7-Flash)耗时 2,350.6 ms / 1,879 次调用耗时 2,516.7 ms / 3,200 次调用耗时降 6.6%,调用少 41.3%
KernelBench (VGG16)达标生成次数缩减基准生成次数生成次数减少2.43倍
KernelBench (LayerNorm)达标生成次数缩减基准生成次数生成次数减少1.79倍
KernelBench (ConvDiv)等预算性能输出基准性能输出性能提升达 2.09倍
KernelBench (ConvMax)等预算性能输出基准性能输出性能提升达 1.44倍

在 GPU 算子工程的 KernelBench 测试中,算力分配优化的收益表现得更加清晰。除了上述两项卷积算子翻倍的性能表现外,VGG16 任务生成次数减少 2.43 倍,LayerNorm 减少 1.79 倍即达到了基线水平。

然而一旦脱离工程代码、进入纯粹的数学极值探索,这套调度策略的表现就出现了分化。在 sum-difference、自相关不等式与 circle packing 三项数学优化任务中,Dream-RSI 分别拿到 1.145427、1.456375 和 2.635983 的得分;虽然在 sum-difference 上胜过固定基线,circle packing 打平,但在自相关不等式上却略逊于固定基线,且得分不及 SimpleTES。


历史回放的盲区与算力账本

Dream-RSI 的核心逻辑在于用离线模拟换在线探索时间,韩非子曾言“因物之相佚而为之治”,顺应已有之迹立规度势固然巧妙,但此法天然带有盲区。

离线回放只能重排既有历史轨迹,无法推演出未知的代码路径(示意图)
离线回放只能重排既有历史轨迹,无法推演出未知的代码路径(示意图)

回放模拟器只能在既有的历史探索树上重新切分蛋糕,无法评估反事实分支。换言之,如果底层模型在早期探索中因为偶然性从未踏入某片高价值代码路径,那么无论控制器在回放模拟器里做多少次推演,都绝不可能凭空变出那根从未存在过的树枝。论文中给出的策略单调提升证明极为严苛,它只保证新策略在眼下这棵既定历史树上的收益不低于上一代,却无法提供跨任务或新分布下的泛化背书。

离线做梦重排的是既有足迹的权重,而不是在未知的荒原上踏出新路。

还有一个常被规避的隐性账本在于全口径开销。论文将成本公式化为探索 Agent 的调用次数,但回放模拟器的构建、使用大语言模型解析并重写控制规则、轨迹存储与离线验证本身都在消耗 Token 与算力。若不计入元搜索控制器自身的推演花销,单一指标的降幅便难称完整。

  • 风险.系统完全受制于外部自动化验证器,若测试用例或基准跑分存在偏差,自适应调度器极易演化出 Reward Hacking,在指标漏洞上过度搜寻虚假收益。

项目目前建有主页与交互 Demo(dream-rsi.com),但官方 GitHub 仓库(zhengkid/Dream-RSI)标注完整代码库、复现脚本仍在准备发布中,尚未提供可运行的实现。值得辨明的是,DeepMind 官方博客近期发布的自提升成果属于 SIMA 2 在 3D 虚拟世界中的经验演化,与当前的 Dream-RSI 是不同项目,DeepMind 官方也未专门发布推文背书。

剥离掉科幻色彩浓厚的叙事外壳,Dream-RSI 给产业界带来的启发依旧务实。当行业受困于复杂代码生成的长程推演开销时,把丢弃的搜索废料改造成离线调度模拟器,确实展现了一条克制且聪明的工程降本路径;至于真正的智能自演化,眼下还轮不到调度算法来谈论破局。