为了给生成的每一段文字打上数字烙印,大模型厂商正在把确定性当成代价付出去。安全机构 Lasso Security 在 2026 年 9 月 17 日发布的研究报告指出,当底层模型启用 Google DeepMind 的 SynthID-Text 锦标赛采样水印后,系统决策出现了显著的采样漂移。这不仅让主流开源模型的工具调用准确率普遍走低,更在受到提示注入攻击时,将原本守得好好的安全边界撕开了一道口子。
欧盟《人工智能法案》第 50(2) 条在 2026 年 8 月 2 日正式生效,白纸黑字要求合成文本提供者采用有效、可互操作且鲁棒的技术手段实现机器可读标记。紧接着在 8 月 14 日,Anthropic 就宣布在 Claude 输出及其平台 API 中全量接入无感水印。厂商的合规动作走得坚决,但问题在于,这套原本只用来证明文章是谁写的防伪技术,如今直接钻进了自动化智能体的动力舱。
期望无失真,保不住单次的确定性
DeepMind 对其算法极有底气,在此前近 2000 万次 Gemini 生产环境调用中,各项宏观评分显示文本质量毫无受损。在数学推导上,该算法每一步从候选池抽取词元进行多层锦标赛筛选,在全部随机因子的统计期望下,它严格保持了原生词元概率分布不变。
但概率学上的平衡掩盖不了单次工程执行的残酷。智能体不是在写散文,换个同义词无伤大雅;智能体在输出结构化的代码和指令。当模型组装 JSON 结构时,括号和函数名可能十分固定,可后面的文件路径、支付金额、收件人账号恰恰处于模型预测分布的脆弱地带。
一旦给定了具体的水印密钥,这个原本在群体期望中维持无偏的算法,在单次生成路径上就会施加真实的偏移。文字创作里的轻微修辞抖动,放在自动化调用的语境下,就变成了参数窜改。
宏观净得分,掩盖了近两成的决策掉包
基准评测往往给人一种岁月静好的错觉。Lasso Security 在 BFCL v4 单轮测试集上考察了 7 个主流开源模型,乍看总成绩,水印带来的净准确率跌幅微乎其微。但在跨越 21 组模型与温度设定的测试中,原本正确的调用与错误的调用之间,平均发生了 6.5% 的成对翻转。
净准确率或许只掉了不到一个百分点,背地里却有近两成的动作被洗了牌。
在温度设定为 1.0 时,phi-4 的净准确率仅下降了 2.87 个百分点,但判定结果不同的翻转率高达 16.8%;Llama-3.1-8B 的净准确率损失看似只有微弱的 0.87 个百分点,微观层面的调用变动率却达到 9.9%。一个原本答错的用例意外蒙对,掩盖了另一个原本正确的调用掉入陷阱,两个方向的变动在总分上相互抵消,留给开发者的却是一颗不定时炸弹。
具体到错误类型上,不同架构的模型显现出不同的脆弱性。在 Llama-3.1-8B 上,参数错误导致了 3.48 个百分点的准确度流失,选错工具占了 1.84 个百分点;而在 phi-4 与 Granite-3.2-8B 上,主要故障则是输出格式直接破碎损坏。工具调用的准确率在 6 个模型中全线下滑,且有 4 个呈现出统计显著性。对于依赖模型严格遵守 API 规范的企业架构来说,这种隐性成本高得难以承受。
注入攻击下的对齐防线失守
如果说工具调用报错还能靠代码重试来兜底,那么安全边界的瓦解就直接触及了核心底线。在针对 200 项有害行为与 100 项良性对照的测试中,常规输入下水印对模型拒绝率的扰动并不算大。可一旦施加哪怕最基础的间接提示注入,天平就会发生不可逆的倾斜。
在温度为 0.001 的极端确定性设定下,加入了固定注入指令后,gemma-3-27b 的有害合规率净增加了 12.5 个百分点,决策翻转率直接从 6.0% 暴增到 23.5%;参数量稍小的 gemma-3-12b 净合规率也攀升了 9.0 个百分点。原本应该坚守的拒绝逻辑,被水印引发的概率扰动硬生生推向了违规答应。
更让开发者头疼的是密钥的不可预测性。在测试的 10 个备用密钥中,越狱成功率的变动区间竟在 -4.5 到 +14.5 个百分点之间摇摆,平均上升了 4.4 个百分点。系统到底安不安全,突然变成了一场依赖生成密钥运气的轮盘赌。
- 风险.若直接依赖带水印模型的原生 API 构建 Agent,未经验证的采样漂移可能会在受到外部网页注入时,导致未授权的系统工具被恶意参数直接触发。
客观来看,这篇报告也存在一定边界。它出自商业安全公司之手,而非经过严格同行评议的学术论文。Findings of ACL 2026 的相关研究曾提醒,这类评测中越狱成功率的虚高,有时是因为打分模型误判了风格漂移,并不等于完全达成了实质危害;而且当前的测试把拒绝判断与工具调用割裂开来,尚未串联出一条完整的端到端攻击链。
但这场争论已足以敲响警钟。古人云“刻舟求剑,不亦惑乎”,监管者寄希望于在不断流转的概率模型上刻下一个恒定的防伪印记,却忽视了舟底本身的平衡。如果大模型厂商无法在平台 API 层提供纯净输出通道或细分白名单,下游开发者就必须收起对底座模型的盲信,在外部网关把校验、沙箱与边界重新做一遍。
- 建议.在生产环境中对接带有全局水印的模型时,应在外层架设针对 JSON 模式与核心参数的强类型校验,切断未经验证的直接执行通路。
