研究者张一凡近日发布技术报告,提出名为 Recurrent Looped Transformer(RLT)的全新模型架构。该设计将因果编码器与带有滑动窗口注意力(SWA)及隐状态传递的循环解码器绑定,试图用固定的权重参数,在序列维度换取所谓无上限的时间推理深度。然而作者在报告开篇便坦陈,其真实的推理收益、硬件执行效率以及强化学习扩展能力仍有待验证。

这并不是一场属于参数复用派的轻松胜利。在标准前馈 Transformer 已经将并行吞吐推至极限的工业界,用强序贯的循环设计换取隐式深度,往往意味着巨大的系统代价。把计算图强行折叠进时序循环,正在迎头撞上吞吐断崖、表征失真与强化学习全量重算的三重工程硬伤。

48+48层的循环构想:拆解时间维度的无限深度

RLT 在结构上采用了 48层编码器与48层解码器 的组合,并在不同阶段共享兼容的注意力和前馈网络权重。编码器负责构建全局键值记忆,解码器则通过跨步携带上一轮的循环输出隐状态,搭配每层的滑动窗口缓存向前推进。每一个 Token 虽只执行 96 个逻辑计算块,但随着序列步长推进,解码路径在时间轴上被不断拉长。

编码器的静态全局记忆与解码器滑动窗口在显存切片中咬合推进(剖面示意)
编码器的静态全局记忆与解码器滑动窗口在显存切片中咬合推进(剖面示意)
RLT 状态流转与双核计算结构 因果编码器 (48层) · 批处理已知 Token · 生成全局 KV 记忆池 · 前缀受限并行计算 循环解码器 (48层) · 局部 SWA 缓存窗口 · 跨 Token 隐状态流转 · 阶段间共享核心权重 状态递推输出 · 序列级时间深度 · 全 BPTT 梯度反传 · 每步依赖历史重构

学界此前对循环深度的探索从未停歇。Ouro 架构曾采用共享的 48 层堆叠并循环展开 4 次,验证了参数复用扩充网络深度的潜力。为了解决循环带来的显存激增,Maglev 架构选择将滑动窗口注意力与循环键值注入结合,把滑窗逐出的信息向下传递;MELT 架构则在每层维护跨推理循环共享的单个键值缓存,阻断显存线性膨胀。

RLT 试图站在这些方案的肩膀上,把编码器的全局上下文与解码器的滑窗循环缝合成一个统一状态转移。但必须厘清的是,该架构所称的无限深度仅存在于序列展开的时间轴,而不是单个 Token 内部进行反复递归的隐式思考深度。

权重复用省下的只是参数体积,它从未免去 GPU 必须逐行履行的计算量。

吞吐骤降68%的账本:参数复用撞上硬件铁壁

许多人直觉认为更少的参数意味着更轻快的运行速度,但在现代硬件调度面前,这个逻辑完全不成立。标准 Dense 模型能够依靠大矩阵乘法吃满显卡算力,而循环架构强制要求解码器沿着 Token 步长串行依赖,导致显卡陷入严重的显存带宽与分发延迟瓶颈。

测试机箱内两块算力卡对比:右侧陷入分发延迟导致风扇怠速
测试机箱内两块算力卡对比:右侧陷入分发延迟导致风扇怠速
300M 循环模型与标准前馈模型的训练吞吐对比 (tokens/s) 12层循环模型 42K 标准 12层 Vanilla 132K 6层循环模型 49K 标准 6层 Vanilla 153K

在同等 300M 参数 的基准测试中,12 层循环模型的训练吞吐仅为 42K tokens/s,而标准 Vanilla Transformer 可以跑出 132K tokens/s,吞吐直接 暴跌 68%;在 6 层规模下,循环模型也仅以 49K tokens/s 大幅落后于标准模型的 153K tokens/s。这种断崖式下跌直观印证了硬件空转的严峻程度。

底层算子分发与同步的开销反客为主。研究记录显示,在 Batch Size 512 条件下引入 CUDA Graphs 优化后,循环架构的单层延迟能从 277.33 ms 锐减至 81.73 ms。这一差距证明,模型并非算力不够用,而是大量的计算时间被细碎的算子下发与同步硬生生耗尽。


强制循环的推理迷思与全量重算代价

不仅底层吞吐堪忧,循环加深带来的算法有效性同样遭受挑战。业界测试发现,强制增加循环步数并不能单调提升推理能力。在下游基准测试中,LoopRPT 实测表明强制递增隐层循环深度反而会让中等与高难度 Token 的准确率出现倒退,网络过深极易诱发隐层表征崩溃。

强化学习策略更新导致先前缓存全部失效,系统被迫从头重算(剖面示意)
强化学习策略更新导致先前缓存全部失效,系统被迫从头重算(剖面示意)

下游评测呈现出极度分化的态势。相比同样采用参数复用的 Ouro-1.4B,引入强化学习控制的 LoopRPT-1.4B 在 MMLU 仅提升 0.27、BBH 仅提升 0.40、HumanEval 微增 0.04;其显著的提升只局限在 MBPP 的 2.38 与 MBPP+ 的 2.91。这种表现更接近针对特定语法结构的自蒸馏早退拟合,而非通用的逻辑推理跃迁。

更现实的制约在于训练基础设施的消耗。LoopRPT 仅仅在 Omni-Math 数学竞赛的 4,428 个样本上训练 3 个 Epoch(保留 200 个样本验证),就动用了 8 张 80GB A100 GPU,针对每个样本进行 8 次带噪隐层展开。

评估维度标准 Transformer循环深度架构(如 RLT / LoopRPT)
训练吞吐效率满血并行,无跨步等待受制于序贯依赖,吞吐跌幅最高达 68%
RL Replay 机制直接复用旧激活与 KV 缓存参数更新使缓存失效,必须全量重算历史
显存与计算开销随上下文长度线性增加参数占用虽少,但重算大幅推高墙钟时间
算子生态成熟度FlashAttention 等高度优化依赖定制 Kernel,Prefill 与 Decode 存在裂痕

RLT 坚持采用全 BPTT 训练与严格的策略重放。一旦策略网络更新,先前缓存的滑动窗口与循环状态全部失效,系统必须从头重跑整个提示词与响应历史。加上预填充与解码阶段底层的计算 Kernel 差异,大规模在线训练的成本将被成倍放大。

  • 风险.在缺乏高度定制化底层 Kernel 的前提下,循环架构节省的模型权重显存,会被全量历史重算所消耗的机时彻底吞噬。
  • 建议.系统工程团队在考量此类架构时,应以等卡时(Wall-clock time)而非等参数量来核算端到端 ROI。

对于关注架构演进的工程师而言,RLT 提供了一种将因果记忆与滑动时序强行打通的实验样本。但在混合专家模型(MoE)与成熟 Dense 架构构筑的工程壁垒面前,这套方案若无法给出高吞吐算子实现与严苛的通用跑分胜率,依然只能停留在学术探索区间。