从今年8月2日起,Claude生成的文字里可能藏着一枚肉眼看不见的印记——不是隐藏字符,也不是元数据,而是模型选词时留下的统计学习惯。Anthropic上周说明了这套机制怎么运作,但真正值得琢磨的不是"怎么做到的",而是这枚水印到底能证明什么,又证明不了什么。

印记藏在选词的骰子里

模型每生成一个词,都会遇到一些等价的候选——句子说"天气阴沉沉的",接下来用"多云"还是"阴天",读者根本不在乎。这类低风险选择原本靠随机数拍板,水印做的是把这个随机数换成密钥算出来的伪随机数:选择依然随机,但选择的来源带着密钥的指纹。检测端不需要碰模型本身,只要有同一把密钥,就能算出一段文字是否符合这个模式。

Anthropic说这是Google DeepMind开源方案SynthID-Text的"一个版本",原始论文2024年发在Nature上,Gemini已经用了两年,在约2000万条真实回复上测过,没发现明显质量损失。Anthropic的说法与此一致:不加价,不影响输出质量。

水印怎么嵌进一句话里 候选词 意思等价 密钥打分 伪随机替代随机数 锦标赛采样 多层筛选 选定用词 输出文本 带隐形印记 检测端只需同一把密钥,无需访问原始模型

测得准的前提,是没人动过手

Nature论文说得直白:这套方法在长文本、开放式回答里检测力最强;越短、越受限的内容——一段代码、一句是非题式回答——留下的统计痕迹越少,检测越不可靠。真正的软肋是改写和翻译:复制粘贴、去掉格式,水印安然无恙,因为印记编码在词的选择本身;但只要有人把整段话重新说一遍,或者扔进另一个模型翻译一轮,水印大概率被冲掉。这不是漏洞,是论文自己列出的已知局限。

再看误报率。业内常引用的"假阳性率1%",是拿人类写的问答内容当阴性样本校准出来的,换一种文体、换一种语言,这个数字未必成立。"检测到水印"是概率判断,"没检测到"也可能只是被编辑过——两种结果都不该被当成呈堂证供。

检测把握,随场景大幅变化 长文本/开放回答 较高 短文本/代码 偏低 强改写/翻译 接近失效 数据来源:Nature论文与DeepMind公开说明

OpenAI没走这条路,说明了什么

有意思的对照是OpenAI。它两年前研究过同样的文本水印思路,最后没做,公开理由是"翻译改写太容易绕过",而且担心把非母语写作者的正常修改误判成AI痕迹。OpenAI转而把精力放在图片和音频上,用SynthID配合C2PA元数据双保险,去年7月底还把这套逻辑扩展到了语音。同一套底层技术,两家公司算的是不同的风险账:Anthropic押"总比没有强",OpenAI押"半吊子的证据比没有证据更危险"。谁对现在看不出来,但这说明这不是一道有标准答案的技术题,是价值判断。

  • 风险.翻译或强改写几乎能让水印失效,蓄意造假者的规避成本,远低于诚实用户被误判的成本。

Anthropic这边还留了几个没关上的口子:检测密钥握在自己手里,检测API什么时候开放、给谁开放、误判了怎么申诉,目前都没公开细节。水印本身不带用户或对话身份信息,这点Anthropic说得明确,不是拿来追踪个人的;但因为没有可靠的地域识别技术,这套机制是全球统一部署,用户没有单独关闭的选项——一条欧盟的合规要求,变成了全球用户的默认设置。


Claude从8月2日起发布的模型已经默认打上这个印记,更早的模型还在陆续补齐。技术本身没什么可指摘的,成熟、代价不高。真正需要提醒的是使用者的预期:学校、雇主、平台如果把"检测到水印"直接当成"这是AI写的"实锤,把"没检测到"当成"这是人写的"清白证明,那是在拿一个概率工具做二元判断。

疑罪从无到有容易,坐实却难——这枚水印测得出机器,测不出诚意。

技术往前走了一步,责任还没跟上。检测API怎么开放、误判怎么申诉,才是接下来真正该盯的事。