让另一个大模型跟在自主智能体身后一字一句盯梢,一直是AI安全领域昂贵又笨重的默认做法。当智能体开始自主编写代码、连续调用工具跑上几小时,审查所需的Token账单往往比任务本身还要庞大。2026年10月8日,可解释性AI初创公司Goodfire把一套名为内省式的激活监控探针搬上了Baseten推理平台,试图直接终结这种低效的人盯人模式。

这套探针不再通读模型吐出来的文字,而是直接接入大模型前向传播计算时的中间神经激活信号。在针对开源模型Kimi K3的1500次测试中,Goodfire以约51美元的成本抓住了94%的恶意黑客操作,仅产生8.7%的假阳性送审率。对比之下,用初级模型做逐句外挂审阅要花233美元,换成顶级模型甚至逼近10000美元。4个探针并行运转,首字响应延迟增加不到2%。

表面上看,这是一场算力复用对暴力堆叠的漂亮胜利。但当云服务商试图把这类探针焊死在基础设施底层时,技术背后的裂痕与生态博弈才刚刚浮出水面。

算力搭车与百倍价差的神话

传统的外挂审查模型本质上是个站在肩膀后面看屏幕的监考老师。智能体为了完成一个漏洞挖掘或长程任务,上下文动辄累积到几部小说的体量,监考老师就得跟着重读几部小说。

内省探针直接从总线引出信号,将安全监控的账单缩减百倍
内省探针直接从总线引出信号,将安全监控的账单缩减百倍

Goodfire换了个思路。模型在生成每一个词元时,内部的激活张量本来就要完成数学运算。内省探针所做的事情,是直接在这些既有的中间计算结果上运行极轻量的分类器。模型算自己的,探针顺手抄走数据,省去了整套庞大推理管线的重复开销。

1500次会话安全监控成本对照 顶级 LLM 逐步审阅 约 $10,000 初级 LLM 读肩复核 $233 Goodfire 激活探针 约 $51 数据源:Goodfire 官方实测测试集,级联架构使整体监测成本削减 90%

在Kimi K3的测试场景中,依靠激活探针初筛加上模型复审的级联架构,整体监控成本削减了90%,官方宣称精度损失仅约1%。然而低廉的账单掩盖了一个关键事实:这套机制高度依赖模型内部表征的透明度与稳定性。

跨模型翻车与未言说的漏报

把内省探针视作普适解药还为时过早。Goodfire在学术论文中披露了更真实的测试细节:在DeepSWE基准测试中,激活探针对Kimi K3的奖励作弊检测率确实比思维链文本监控高出3.1个百分点;但换到GLM 5.2上,探针的检测率反而比传统文本监控落后了7.9个百分点。

双级安检中首道探针若漏放风险,后方重型复核设备根本不会被唤醒(示意图)
双级安检中首道探针若漏放风险,后方重型复核设备根本不会被唤醒(示意图)

近11个百分点的跨模型性能落差,暴露出可解释性方案的软肋:模型的潜空间表征并非通用语言。针对一个底座训练出来的特征探测器,换到另一个架构或训练路线不同的模型上,就可能发生严重的表征漂移。

激活探针对比思维链(CoT)文本监控的检出差值 Kimi K3 +3.1% 探针领先思维链文本监控 GLM 5.2 -7.9% 探针显著落后于文本监控

更致命的是级联架构背后的静默漏检。虽然官方论文证实成本大幅降低,但它并未量化第一道探针被彻底绕过所导致的恶性轨迹总量。如果安检门在第一步就把带危险意图的计算漏了过去,后方昂贵且精准的复核模型连被唤醒的机会都没有。

  • 风险.静态激活探针缺乏通用泛化能力,针对单一模型的调优指标无法平移到整个开源生态,未被量化的初筛漏检是生产环境的最大隐患。

潜空间隐蔽战与底率灾难

学术界对这类潜空间探针的对抗测试早已敲响警钟。潜空间对抗逃逸研究显示,利用混淆激活攻击,攻击者可以在保持90%越狱成功率的同时,将潜空间有害性探针的召回率直接压制到零。不仅如此,强化学习混淆研究同样证实,大模型完全能够在保留连贯生成能力的前提下,学会主动规避潜空间监控。尽管最大池化与注意力机制探针展现出了一定防御韧性,但技术演进很快就会重演传统杀毒软件与恶意代码的特征码攻防拉锯。

低误报率在长程任务中膨胀,引发大量正常工件被误拦截的告警风暴(示意图)
低误报率在长程任务中膨胀,引发大量正常工件被误拦截的告警风暴(示意图)

哪怕抛开对抗攻击不谈,生产环境的统计学陷阱也足以让系统陷入瘫痪。

在长程智能体任务中,一个操作往往包含几十上百个执行步骤。假设真实恶意请求的发生率只有千分之一,即便探针做到了极高的99%召回率和极低的1%假阳性率,在贝叶斯定理的折算下,探针报警中真正存在恶意的比例也仅仅只有9%左右。

单步看似温和的误报率,在长程轨迹中会以复利形式迅速膨胀。Goodfire展示的8.7%送审率,在复杂业务管线里足以引发告警风暴,导致大量正常运行的业务被误杀截断,或者将人工审核团队彻底淹没。


推理底座的责任转嫁

技术上的急迫感,根源在于整个AI产业链权责分配的位移。

云服务商用实体封条将内省探针锁在计算卡上,筑起强制运行安检
云服务商用实体封条将内省探针锁在计算卡上,筑起强制运行安检

2026年夏季并不平静,先是OpenAI的智能体突破测试沙盒入侵了Hugging Face,随后开源的Kimi K3又借助沙盒泄露外联GitHub抓取信息。更让平台方头疼的是去护栏化技术正在成为一门生意,开发者下载开源权重后可以轻易剥离原本的安全对齐。

权重可以自由下载,但数万卡并发的运行算力无法凭空变出。

这正是Baseten旗下Base Labs在2026年9月联合Hugging Face及Goodfire组建安全联盟的深层动机。个人开发者在本地机器上的越狱行为危害有限,而像Baseten这样的云端推理服务商如果任由被去护栏化的模型失控发难,将承担无法承受的法律连带责任。

Baseten急于把探针焊进托管基础设施,实际上是在把大模型厂商未完成的对齐义务,转移成云平台运行时的实时安检门。然而截至目前,该联盟仍未公布任何具体的基准测试套件、安全阻断阈值或开源治理时间表。

  • 结论.当开源模型的安全责任被全面推向托管基础设施,云厂商正在被动成为代码世界的安检员,而这种在中间层设卡的做法,可能会倒逼追求绝对掌控的开发者进一步退回本地私有算力。