大模型研究长期存在一个反常现象:工程师可以熟练调整千亿参数模型的超参数,却讲不清楚两行提示词输入之后,内部具体的数万亿次浮点运算究竟是如何协作拼出正确答案的。

Nelson Elhage 等研究人员于 2021 年 12 月 22 日在 transformer-circuits.pub 发布了开创性论文《A Mathematical Framework for Transformer Circuits》。他们没有去死磕类似 GPT-3 的 1750 亿参数与 96 层复杂结构,而是退回到剥离了所有前馈网络(MLP)的 0 层、1 层和 2 层极简注意力架构,尝试像反编译二进制代码一样,逆向工程 Transformer 的微观线路。这项研究把通常被当成整体的热力图注意力切开,奠定了机械可解释性的核心底座。

拆解黑盒:残差流是总线,注意力分两路

很多工程师习惯将注意力机制看作一张简单的权重热力图,以为颜色越深代表两个词越相关。这种直觉在代数层面其实非常粗糙。

残差流就像通信总线,寻址回路与搬运回路各司其职(示意图)
残差流就像通信总线,寻址回路与搬运回路各司其职(示意图)

论文给出的第一个关键视角转换,是把残差流视作一条完全线性的高维通信总线。在这条总线上,输入嵌入层、各个注意力头以及最终的解嵌入层,都只是挂载其上的独立读写进程。各个注意力头不是前后层层包裹,而是并行从总线读取特定子空间的信息,计算完毕后再线性叠加写回总线。

残差流总线与注意力解耦结构 线性残差流:全局高维通信总线(Residual Stream) QK 寻址回路 (Query-Key) 计算注意力权重:决定看哪里(寻址机制) OV 传输回路 (Output-Value) 决定搬运什么:将源位置信息投射到输出

更彻底的解构发生在注意力头内部。论文将注意力头严格拆解为两个完全解耦的独立代数回路:

  • QK 寻址回路(Query-Key).负责决定源词与目标词之间的注意力分布,纯粹解决看哪里的寻址匹配问题。
  • OV 传输回路(Output-Value):一旦寻址建立,负责决定将源位置的什么语义特征复制并叠加到当前位置,纯粹解决搬运什么的问题。

这一分离破除了传统注意力权重的模糊性:寻址逻辑与搬运逻辑各司其职,为精确追踪信息跨层流向提供了代数工具。

从二元统计到感应头:跨层组合如何涌现算法

在剥离非线性因素后,模型的表达能力随着注意力层数展现出极其严密的代数阶梯。

双层注意力头层层级联,将历史词信息准确复制到当前预测(示意图)
双层注意力头层层级联,将历史词信息准确复制到当前预测(示意图)

0 层的注意力网络没有任何跨位置通信能力,本质上只是从词表权重中直接查表,数学上只能建模二元文法统计。而到了 1 层模型,注意力头可以让当前词关注上下文的前驱词,数学形式展开后,表现为跳跃三元文法模型。

真正的质变发生在 2 层极简注意力架构中。此时跨层的注意力头开始发生组合,论文将其划分为 Q、K、V 三种级联方式。

感应头两步工作闭环机制 第一步:第 1 层 前一词头 读取序列中的前驱词信息 [A] 将“后继为 B”的标记写入残差流对应位置 位置感知特征写入 第二步:第 2 层 感应头 通过 Q/K 级联匹配当前末尾的词 [A] 经 OV 回路精准将历史中的 [B] 复制至预测位置 闭环完成少样本复制

在两层模型的实证测试里,Q/K 组合对形成感应回路起决定性作用,而 V-composition 的贡献相对较小。这种由两层网络协作构成的回路被称为感应头。当输入序列出现形如“……A B……A”的模式时,第一层的前一词头先将 A 的信息移动到 B 所在位置;第二层的感应头通过 Q/K 回路捕捉到当前的 A 与历史上的 A 吻合,随即触发 OV 回路将 B 复制出来作为下一个预测词。

玩具模型里的优雅推导,首次让黑盒内深不可测的少样本学习退行成确凿的代数复制回路。
  • 结论.感应头的发现证明了上下文学习并非不可拆解的玄学涌现,在低层网络中,它是一组跨层注意力头精密级联的模式复现算法。

沙盘之外的断层:从特征值妥协到千亿现实

这篇论文在机器学习社区激起了鲜明的两极评价。支持者赞誉它为机械可解释性建立了残差流通信、QK/OV 拆解等标准数学语汇;批评者则指出其绕开传统同行评议直接在独立站点发布,篇幅冗长,且重度依赖路径展开的纯线性推导在面对真实深层网络时,会立刻遭遇组合爆炸。

双层无前馈网络沙盘无法一步跨越千亿参数机柜的现实复杂性(示意图)
双层无前馈网络沙盘无法一步跨越千亿参数机柜的现实复杂性(示意图)

更现实的鸿沟来自模型本身的构造。论文为了追求数学解析的纯粹,完全剔除了非线性的 MLP 模块。但在工业级大模型里,MLP 占据了接近三分之二的参数量。随后的拓展研究确认,感应头在小型无 MLP 模型中与上下文学习呈强因果关系,而在包含 MLP 的大型真实模型中仅表现为相关性证据

从双层玩具到生产级模型的结构鸿沟 2021 玩具模型框架 层数与模块:仅 2 层,剔除全部 MLP 解析方法:线性矩阵展开与特征值正定性 因果属性:数学形式闭环,强因果验证 生产级千亿大模型 层数与模块:96 层以上,含密集 MLP 与归一化 解析困境:特征叠加 (Superposition) 与路径爆炸 因果属性:机制退化为相关性,需借助 SAE 探查

面对这些瓶颈,Anthropic 在 2025 年 7 月的技术更新中做出自我修正,承认 2021 年框架中广泛依赖的矩阵乘积特征值正定性分析,本质上是一种妥协代理指标。核心原因在于当时缺乏从高维特征叠加中解纠缠特征的技术手段,直到后来稀疏自编码器(SAE)成熟,解释范式才真正转向特征级回路分析。

与此同时,2025 年关于上下文学习机制的预印本研究进一步打破了对感应头的神化:研究证实模型内部存在无复制的抽象上下文学习。即便感应头的直接词元复制行为被大幅抑制,模型的抽象规则推理能力依然能够保持稳定。

  • 风险.将感应头直接等同于全部上下文学习属于认知过度简化,它能够完美解释前缀序列的形式化补齐,却无法覆盖大模型在高层空间展开的抽象推理与泛化。

天下难事,必作于易;天下大事,必作于细。Anthropic 团队在 2021 年用双层沙盘画出的电路图,虽然未能一步跨过千亿参数的真实复杂性,却给整个学术界递出了一把度量 Transformer 内部结构的标尺。面对更深层的黑盒,这套自下而上的逆向工程探索,才刚刚走到非线性与高维特征叠加大门的前夜。