一段文字里看不到任何像素、也留不下任何元数据,却能被悄悄打上标记——这就是AI文本水印。declaude.org最近用一组交互图解把这件事讲透了:模型写每个词的时候都在几个"同样合适"的候选里掷带偏向的骰子,密钥悄悄给候选词染色,持有密钥的人只需要数颜色就能判断这段文字是不是AI写的。Anthropic已经在2026年8月给新版Claude模型接上这套机制,旧模型将陆续跟进;Google的SynthID Text从2024年5月14日起就用在Gemini App和网页版里,只有API是文档写明的例外。
机制讲清楚了,但公众最容易脑补的那句话——"水印=AI鉴伪神器"——恰恰是Google自己先否认的。
测不到水印,不代表是人写的
Google在SynthID的官方说明里写得很直白:这套系统不是通用AI检测器,它只能识别自己主动嵌入的信号。检测不到信号,可能是文本真的出自人手,也可能是水印被编辑掉了,或者模型本身没开这个功能。
这个限定原文的图解版并没有专门强调,但它才是真正影响判断的部分。学校查论文、平台查内容、媒体查稿源,如果把"没测出水印"直接当成"人写的"证据,那就是把一个概率工具当成了确定性判断,风险全压在了误读上。
- 提醒.水印检测只回答"是不是我打的标",回答不了"到底是不是AI写的"。
扛得住裁剪,扛不住重写
水印的鲁棒性有清晰的边界。裁剪、有限的同义词替换、轻度改写,水印基本能扛住;但一旦经过大幅重写或跨语言翻译,检测置信度会明显掉档。
在公开可测的实现上,完整重写后大约只有0.5%的原文片段还能对上密钥的染色规则,检测准确率(AUC)从几乎百分百的0.99跌到接近硬币抛掷的0.5;而不依赖上下文、只跟单个词绑定的老式水印更顽固,同义改写后仍有0.73到0.84的片段存活,只是这类水印本身容易被反推出染色规律。轻度改写倒是"稀释"而非"删除"水印,论文数据显示改写量在800个token(约600词)左右,水印信号又会重新变得可测。短文本、事实性回答、只有一种正确说法的内容,本身候选词选择空间就小,水印能藏的信息量也少。
水印能验真,却验不了假,这是它和"AI检测器"最大的区别。
两年时间差里藏着的变量
Google把SynthID铺进Gemini App和网页版是2024年5月,API被明确排除在外;Anthropic直到2026年8月才让新版Claude加水印,旧模型还要"陆续跟进"。这个时间差不是技术难度的问题——红绿词表方案2023年就有公开论文,SynthID的锦标赛式采样细节也早在2024年随论文发表。
更可能的解释是合规节奏。欧盟AI Act第50条要求AI生成内容要能被标识,直接面向终端用户的产品(App、网页聊天界面)更容易被纳入监管审视,而API调用方通常是企业客户,自己承担内容标识义务——这也许解释了为什么API长期是水印的"例外区"。Anthropic选择在2026年才补上模型层水印,更像是把合规和产品优先级重新排了一遍,而不是技术上突然想通了什么。
对普通用户而言,这套机制眼下最实际的意义是:靠水印判断一段文字是不是AI生成,只能在"字数够长、没被大改"的窄条件下成立。学校、媒体、平台如果拿它当万能鉴伪工具,踩坑的概率比想象中高得多。
