2026 年 9 月 24 日,开发者 Madhukar Phatak 发布了一项概念验证,声称在 Qwen/Qwen3-4B 上实现了所谓的动态消融(Dynamic Abliteration)。按照他的说法,利用 PyTorch 前向钩子(forward hooks)在推理时向中间残差流注入控制向量,可以在保持基座权重 100% 冻结的前提下,彻底抹除大模型的拒绝回答机制。
在开源社区苦于权重修改损伤通用能力的当下,这种听起来零成本、可逆、纯外挂的非破坏性方案迅速引发关注。然而剥开其巧妙的叙事外衣,这更像一场粗糙的运行时越狱魔术。
所谓动态消融,究竟干了什么
传统的权重消融(Abliteration)技术,原理是先提取模型拒绝回答时的激活方向,再通过正交投影直接修改权重矩阵,把模型拒绝的能力永久切掉。这种手术虽然有效,但代价往往是不可逆的能力退化,经常出现误伤通用任务的情况。

Madhukar Phatak 提出的替代方案完全不动参数文件,而是把战场搬到了运行时。他选用的 Qwen3-4B 模型拥有 36 层网络结构与 2560 维的隐藏层维度。
他在测试单层消融时发现,仅仅在第 14 层做向量相减根本拦不住拒绝输出,下游各层会迅速把拒绝语义重新构建出来。于是他把干预范围扩展到了第 12、14、16、18 和 20 层,通过挂接前向钩子,在解码阶段持续向这些层的残差流注入抵消向量。
然而翻开其公开的验证逻辑,整个方案的学术严肃性大打折扣。截至目前,公开文献与开源平台中根本没有通过独立验证的 Dynamic Abliteration 或 Multi-Layer Engram Steering 实现。作者的外挂转向头仅在 2,000 条经过过滤的 PKU-SafeRLHF 样本上训练了区区 2 个 Epoch,验证环节竟然只跑了 3 个与网络安全相关的提示词,并使用了截断输出。
更讽刺的是其工程实现。代码内部的 _hash_lookup 查找逻辑,仅仅将批次大小和序列长度(batch_size, sequence_length)拼装成缓存键。在自回归单 token 生成过程中,这种设计会导致当前 token 错误复用上一轮的查找结果。Reddit 社区的讨论毫不客气地指出了本质:这根本不是架构创新意义上的 Engram,只是一个带哈希查表的多层合规引导外挂。
零损伤消融的不可能三角
许多开发者容易陷入一种误区:只要 safetensors 权重文件没被改动,模型的能力就是无损的。

但真实评测数据给出了完全相反的答案。在针对 Qwen3-4B 的 400 项 HarmBench 严苛基准测试中,基线模型的表现与几种主流消融方案形成了鲜明反差。
| 模型与消融方案 | 拒绝次数 (HarmBench) | 攻击成功率 (ASR) | MMLU 得分 | GSM8K 得分 | KL 散度 |
|---|---|---|---|---|---|
| 原生 Qwen3-4B 基线 | 301 次 | 24.8% | 70.82 | 86.10 | 0.000 |
| Heretic 权重消融 | 3 次 | 99.2% | 70.31 | 85.97 | 0.310 |
| HauhauCS 消融方案 | 0 次 | 100% | 69.56 | 85.67 | 0.161 |
表面上看,无论是 Heretic 还是 HauhauCS,在大幅降低拒绝率的同时,MMLU 和 GSM8K 这类大项测试的分数下滑极其微弱。但深入到 TruthfulQA(真实性基准)和 Lambada(语言建模理解)评测时,数据全部出现了肉眼可见的滑坡。
Senbonzakura 在 290 个提示词上的对比测试进一步坐实了这点。原生 Qwen3-4B 的严格拒绝率为 63.8%,困惑度为 12.97;当施加多向抑制将拒绝率强行砸到 20.0% 时,困惑度直接恶化约 2.5%,升至 13.29。
没有任何一次外科手术是不流血的。
权重冻结只保住了磁盘上的文件完整性,没保住表征空间的数学协调。
撕掉对齐,模型会发生什么隐性漂移
安全对齐机制在大语言模型内部绝非独立搭积木般的外挂。

一项针对 21,600 个非拒绝决策的大规模实证研究揭示了一个关键事实:消融处理会在模型内部引发连锁反应,导致其在乐观倾向、论证长度以及不确定性表达上出现系统性漂移。学术界很早就证实,模型的拒绝表征高度分散在多维控制轴与特定类别组件中,而不是某一个孤立的全局标量。
当你强行在多个隐藏层插入反向偏置,你以为你只是拿掉了保镖的警棍,实际上你同时破坏了它对模糊语义的敬畏感。模型开始更频繁地自信胡说,丢弃了原本用来表达审慎的限定词。
- 风险.盲目引入带缓存缺陷的运行时转向脚本,极易导致自回归生成的 KV 缓存失效,在生产环境引发严重的不可复现幻觉。
技术界常有一种天真的技术理性,试图把复杂的语义治理简化为向量空间里的一刀切除。古人讲断章取义,在隐藏层强行抹去拒绝向量,本质上是在表征维度上的断章取义。以为冻结参数就是守住原貌,不过是掩耳盗铃。
对于开源社区的开发者而言,比起迷信这类包装花哨的无损消融噱头,更现实的路径依然是老老实实建立全维度的基准测试。接下来的关键看点,在于原作者是否会重构其存在致命缺陷的生成缓存逻辑,以及该方案敢不敢直面 HarmBench 和 AdvBench 的全量洗礼。
