为了给生成的每一段文字打上数字烙印,大模型厂商正在把确定性当成代价付出去。安全机构 Lasso Security 在 2026 年 9 月 17 日发布的研究报告指出,当底层模型启用 Google DeepMind 的 SynthID-Text 锦标赛采样水印后,系统决策出现了显著的采样漂移。这不仅让主流开源模型的工具调用准确率普遍走低,更在受到提示注入攻击时,将原本守得好好的安全边界撕开了一道口子。

欧盟《人工智能法案》第 50(2) 条在 2026 年 8 月 2 日正式生效,白纸黑字要求合成文本提供者采用有效、可互操作且鲁棒的技术手段实现机器可读标记。紧接着在 8 月 14 日,Anthropic 就宣布在 Claude 输出及其平台 API 中全量接入无感水印。厂商的合规动作走得坚决,但问题在于,这套原本只用来证明文章是谁写的防伪技术,如今直接钻进了自动化智能体的动力舱。

溯源链条如何演变为执行故障 法规约束 欧盟 AI 法案 第 50(2) 条强制 机器可读溯源 底层植入 SynthID-Text 锦标赛采样算法 微调词元概率 生成漂移 单次决策失真 固定密钥偏差 低熵字段动摇 执行风险 工具参数填错 格式完全损坏 注入攻击失守

期望无失真,保不住单次的确定性

DeepMind 对其算法极有底气,在此前近 2000 万次 Gemini 生产环境调用中,各项宏观评分显示文本质量毫无受损。在数学推导上,该算法每一步从候选池抽取词元进行多层锦标赛筛选,在全部随机因子的统计期望下,它严格保持了原生词元概率分布不变。

但概率学上的平衡掩盖不了单次工程执行的残酷。智能体不是在写散文,换个同义词无伤大雅;智能体在输出结构化的代码和指令。当模型组装 JSON 结构时,括号和函数名可能十分固定,可后面的文件路径、支付金额、收件人账号恰恰处于模型预测分布的脆弱地带。

一旦给定了具体的水印密钥,这个原本在群体期望中维持无偏的算法,在单次生成路径上就会施加真实的偏移。文字创作里的轻微修辞抖动,放在自动化调用的语境下,就变成了参数窜改。

宏观净得分,掩盖了近两成的决策掉包

基准评测往往给人一种岁月静好的错觉。Lasso Security 在 BFCL v4 单轮测试集上考察了 7 个主流开源模型,乍看总成绩,水印带来的净准确率跌幅微乎其微。但在跨越 21 组模型与温度设定的测试中,原本正确的调用与错误的调用之间,平均发生了 6.5% 的成对翻转。

净准确率或许只掉了不到一个百分点,背地里却有近两成的动作被洗了牌。

在温度设定为 1.0 时,phi-4 的净准确率仅下降了 2.87 个百分点,但判定结果不同的翻转率高达 16.8%;Llama-3.1-8B 的净准确率损失看似只有微弱的 0.87 个百分点,微观层面的调用变动率却达到 9.9%。一个原本答错的用例意外蒙对,掩盖了另一个原本正确的调用掉入陷阱,两个方向的变动在总分上相互抵消,留给开发者的却是一颗不定时炸弹。

宏观跌幅与微观翻转的认知断层 -0.87% Llama-3.1-8B 净准确率降幅 看似影响极小的总体指标 16.8% phi-4 工具调用翻转率 微观层面行为发生剧烈变更 +12.5% 注入下 Gemma 有害合规增幅 安全对齐防线被实质性削弱

具体到错误类型上,不同架构的模型显现出不同的脆弱性。在 Llama-3.1-8B 上,参数错误导致了 3.48 个百分点的准确度流失,选错工具占了 1.84 个百分点;而在 phi-4 与 Granite-3.2-8B 上,主要故障则是输出格式直接破碎损坏。工具调用的准确率在 6 个模型中全线下滑,且有 4 个呈现出统计显著性。对于依赖模型严格遵守 API 规范的企业架构来说,这种隐性成本高得难以承受。


注入攻击下的对齐防线失守

如果说工具调用报错还能靠代码重试来兜底,那么安全边界的瓦解就直接触及了核心底线。在针对 200 项有害行为与 100 项良性对照的测试中,常规输入下水印对模型拒绝率的扰动并不算大。可一旦施加哪怕最基础的间接提示注入,天平就会发生不可逆的倾斜。

在温度为 0.001 的极端确定性设定下,加入了固定注入指令后,gemma-3-27b 的有害合规率净增加了 12.5 个百分点,决策翻转率直接从 6.0% 暴增到 23.5%;参数量稍小的 gemma-3-12b 净合规率也攀升了 9.0 个百分点。原本应该坚守的拒绝逻辑,被水印引发的概率扰动硬生生推向了违规答应。

更让开发者头疼的是密钥的不可预测性。在测试的 10 个备用密钥中,越狱成功率的变动区间竟在 -4.5 到 +14.5 个百分点之间摇摆,平均上升了 4.4 个百分点。系统到底安不安全,突然变成了一场依赖生成密钥运气的轮盘赌。

  • 风险.若直接依赖带水印模型的原生 API 构建 Agent,未经验证的采样漂移可能会在受到外部网页注入时,导致未授权的系统工具被恶意参数直接触发。

客观来看,这篇报告也存在一定边界。它出自商业安全公司之手,而非经过严格同行评议的学术论文。Findings of ACL 2026 的相关研究曾提醒,这类评测中越狱成功率的虚高,有时是因为打分模型误判了风格漂移,并不等于完全达成了实质危害;而且当前的测试把拒绝判断与工具调用割裂开来,尚未串联出一条完整的端到端攻击链。

但这场争论已足以敲响警钟。古人云“刻舟求剑,不亦惑乎”,监管者寄希望于在不断流转的概率模型上刻下一个恒定的防伪印记,却忽视了舟底本身的平衡。如果大模型厂商无法在平台 API 层提供纯净输出通道或细分白名单,下游开发者就必须收起对底座模型的盲信,在外部网关把校验、沙箱与边界重新做一遍。

  • 建议.在生产环境中对接带有全局水印的模型时,应在外层架设针对 JSON 模式与核心参数的强类型校验,切断未经验证的直接执行通路。