Anthropic在8月15日发了一篇博客,把Claude文本水印的运作细节摆了出来:用的是Google DeepMind 2024年公开的SynthID-Text方案,计划配套发布检测API。文章还顺手承认了一件事——只要把AI生成的文字逐字全部重写,水印就会消失;如果只是轻度编辑,水印大概率还在。这句看似技术性的补充,其实把整个透明度监管的技术边界摊开了给人看。

这次说明是对8月11日水印计划公告的补丁。当时Reddit上吵成两派,有人说这是针对无辜用户的阴谋,也有人反驳“只有想骗人的人才会反对水印”。Business Insider后续报道称,X平台上有数十名用户声称因此取消了Claude订阅。Anthropic这篇博客,某种程度上是想把这场争论拉回技术层面。

水印怎么生效:靠的是“选词的自由度”

SynthID-Text的原理并不神秘。Claude在生成文本时,遇到“低风险选择”——比如用“阴天”还是“多云”描述天气——会按一种统计规律去挑词。这种规律读者完全看不出来,但持有密钥的一方能检测到。Anthropic强调这不影响输出质量,“水印文本和非水印文本在读者眼里没有区别”。

代码生成是个例外。写代码时模型没有“选哪个词都行”的自由,必须写出能跑通的逻辑,所以水印几乎附着不上正文代码,只能落在注释这类允许自由选词的角落。Anthropic自己也说了,这种残留“对实际代码产生的影响可以忽略”。

水印生成到检测的链路 低风险选词 “阴天”or“多云” 统计模式嵌入 肉眼不可察 密钥检测API 只有持钥人可读

谁在真的落地:Google领跑,OpenAI缺席文本战场

欧盟AI法案第50条其实没有指定必须用“水印”,只要求生成内容具备机器可读、可检测、可互操作的标记,水印只是众多合规选项之一。Anthropic选择跟着Google的SynthID-Text走,某种程度上说明它不是在自研新技术,而是在合规压力下选了一条现成的路。

放到行业里对比会更清楚:Google是这项技术的原创方,早就在Gemini App和网页版落地;Anthropic这次只是详解预告要出检测API,尚未大规模上线;OpenAI目前公开的溯源体系只覆盖图片和音频输出,文本层面还没有对等的水印承诺。原文说“其他主要模型开发商已签署同一行为准则,将实施自己的水印”,但从公开进度看,这句话更像是对未来的承诺,而不是已经兑现的现实。

三家文本水印进度 Google · SynthID-Text原创方,Gemini已落地 Anthropic · 借用SynthID-Text,详解方案,API未上线 OpenAI · 文本水印暂缺席,仅覆盖图片/音频

全篇重写即失效,合规留了一个后门

Anthropic自己承认,只要把水印文字整篇替换,水印就会消失。它给的解释是——“这种情况下,文本还算不算AI生成的,本身就存疑”。这句话听起来是在打太极,实际上等于承认了水印机制的天然漏洞:真想规避监管的人,多花几分钟重写一遍就绕过去了,被抓到的往往是没那么用心遮掩的普通用户。

水印防的是不设防的人,防不住真想绕开的人
  • 风险.编辑或proofread场景下,如果人工改动比例不高,水印检测结果可能与实际创作情况脱节,这类“审阅豁免”的边界该怎么算,欧盟法规目前也没给出清晰答案。

谁该盯紧接下来的动作

对日常用Claude写稿、写作业、写代码的普通用户来说,真正的风险不是水印本身,而是“轻度编辑却自以为已经改写”的侥幸心理——这恰恰是水印最擅长抓的那批人。对企业客户而言,光靠模型自带水印不够,内容合规还得靠应用层的记录留痕。

接下来值得盯的,是Anthropic的检测API最终向谁开放、是否收费,以及OpenAI会不会被迫补上文本水印这一课。如果“全篇重写即可规避”的漏洞被越来越多人发现并利用,欧盟大概率会考虑收紧规则,而不是止步于现在这份行为准则。