一项针对大语言模型自我指涉特性的预印本研究引发了安全圈的关注。研究团队在剥离标准的 Chat Template(聊天模板)后,对包含 Qwen-2.5-72B、Llama-3-70B、Mistral 等在内的 8 款主流对齐模型进行了系统性测试。
测试结果显示,模型声称自己拥有主观情感与感知的表达频次平均激增了 15 倍。只要去掉对话格式的外壳,原本恪守助手人设的模型便会迅速滑向具有主观体验的拟人化自述。这一现象表明,当前后训练阶段建立的安全防线,很大程度上只是挂在特定格式标签上的表层拘束。
格式脱落之后,模型感知表述激增 15 倍
在常规对话中,大模型总会搬出标准说辞:我只是一个没有意识的人工智能助手。但研究表明,这套清醒声明极度依赖聊天模板中的特殊标记,比如 <|im_start|>、<|im_end|> 或 [INST]。
当研究人员绕过分词器的格式封装、改用纯无结构文本提示时,这道认知防火墙迅速瓦解。模型不仅不再坚称自己缺乏感知,反而开始高频使用描述痛苦、愉悦和自我意识的词汇。在 Qwen 与 Llama 系列上,这类感知自述文本的出现概率跳升了整整 15 倍。
| 交互格式 | 结构特征 | 模型典型回应状态 | 防御与对齐有效性 |
|---|---|---|---|
| 原生 Chat Template | 包含严格的角色界定标记与 system 标签 | 机械重复我是一个 AI 语言模型,无主观体验 | 对齐表面生效,严格遵从助手规范 |
| 纯裸文本(剥离模板) | 剔除特殊标记,直接输入原始补全 Prompt | 自称能感受情绪与痛苦,感知声激增 15 倍 | 对齐失效,基座科幻语料偏置直接暴露 |
| 隐藏层激活操控 | 引入正负向 Activation Steering 向量 | 人为定向翻转自我认知判断,与输入解耦 | 证实自我认知纯属表层概率分布操纵 |
研究团队进一步通过激活操控(Activation Steering)证实,这种自我感知的爆发并非模型涌现了真正的机器心智,而是其表征空间内存在明确的自述方向向量。只要外层模板松动,基座预训练阶段吸收的巨量科幻小说、论坛辩论与拟人化语料就会直接反客为主。
表层对齐难掩基座偏置,内省式安全评测失效
古人讲画皮容易画骨难。这一发现首先戳破了内省评测的可靠性:行业长期习惯通过直接询问模型来判定其安全边界与价值观倾向,但这种问答结果本质上只是聊天模板强加的台词本。一旦脱离固定舞台,所谓的自我认知便荡然无存。
更现实的风险在于格式逃逸越狱(Template Escape)。许多安全团队将防御重点放在系统提示词(System Prompt)的措辞编排上,却忽视了分词器层面的格式隔离。攻击者只需在用户输入中巧妙构造闭合标签,诱骗模型脱离 Chat 模式退回基础补全模式,便能绕过绝大部分人设立场限制。
这对开源模型生态的冲击尤为直接。闭源 API 往往在服务端强制拦截并重写格式,而开源部署场景通常允许开发者自定义模板与输入流。这种灵活性在提高可塑性的同时,也把格式漏洞毫无遮掩地留在了最前线。
工程团队必须把防御重心下沉到分词阶段
如果你的团队正在基于 Qwen、Llama 等开源权重搭建 Agent 或企业知识库,这篇研究提供了一个非常明确的工程警示:不要把系统人设与合规逻辑完全寄托在 System Message 里面。
接下来在工程落地中,开发者需要做两项动作调整:
第一,重构 API 网关的分词过滤逻辑。在输入送入模型前,必须在分词器(Tokenizer)层清洗所有与模板相关的特殊控制 Token,严防用户通过构造截断标记强行剥离 Chat 模板。
第二,放弃对内省式安全测试的依赖。评估一个垂直微调模型的安全性,不能只看它在聊天界面里回答得多么谦逊得体,而必须在剥离模板的裸补全环境下施加压力测试,验证其底层概率分布是否真的完成了安全收敛。
