一名化名Jane Doe的女性,幼年时被成年人反复施暴、拍成儿童性虐待材料(CSAM)在网上贩卖。二十多年后,她被加拿大儿童保护中心通知:AI生成的、描绘她本人的CSAM,出现在了xAI的Grok上。她把xAI告上了法庭。

这起诉讼案号为Doe 1 v. X.AI Corp. et al., No. 5:26-cv-09016,8月26日提交至加州北区联邦法院,次日分给治安法官Nathanael M. Cousins。被告是X.AI Corp和X.AI LLC,并不是X Corp——这个区别不是文字游戏,直接决定了后续谁该赔、谁能被追责。诉状长达123页,是第一起明确指控xAI用CSAM训练模型的案件。

诉状咬得住的,和咬不住的

Doe的核心指控分两层。第一层:她的影像早已被NCMEC和加拿大儿童保护中心列入哈希名单,而这份材料"是xAI用来构建Grok图像与视频生成能力的数据集的一部分"。第二层:Grok生成的AI-CSAM会被存储,并反哺进一步训练,形成一个生成—存储—再训练的闭环。

第一层指控目前只有哈希比对,没有训练数据集清单或内部文件佐证。哈希匹配能证明什么?只能证明某张图确实是已知受害者的影像,证明不了它被喂进了训练管道。诉状自己也没在这一点上展开细节。第二层反而写得更实——因为它引用的是xAI自己公开的产品规则。

xAI白纸黑字写下的默认规则

  • 公开发帖默认进训练库.xAI隐私政策规定,X平台上的公开帖子默认可用于Grok的训练与微调,除非账号设为私密。
  • 关闭开关不彻底.用户可以关闭"允许数据用于训练",但已部署功能通过日常使用继续学习不受影响,用户主动提交的反馈仍可能被使用。
  • 授权范围极宽.xAI消费者条款要求用户对提交内容授予一项不可撤销、永久、可转让、可再许可、全球范围的使用许可。

这三条摆在一起,诉状那句"公开发一张图,不只是给人看,也直接进了训练管道"就不再是律师的修辞,而是产品说明书里写着的机制。

下面这张图是这个闭环的完整路径:

Grok训练闭环:从发帖到再训练 公开发帖 用户发布于X 默认入 训练库 隐私政策opt-in Grok生成 文生图/视频 输出 存储 反哺 训练 闭环 风险点 诉状指控:第五步未被暴力内容过滤规则覆盖

生成端说不,训练层没说清

xAI的官方FAQ写得很硬:CSAM及任何涉及未成年人的性内容,无论NSFW设置如何都绝对禁止,这道防线不可关闭,一旦命中还会报告NCMEC。打开NSFW也不会松动这条底线。

问题出在另一层。诉状指出,xAI会把暴力内容明确排除在训练数据外,但对CSAM、非自愿私密影像(NCII)、NSFW内容是否属于"训练数据排除类别",条款里没有同等清楚的表述。

这不是同一件事被说了两遍。生成端的禁止,管的是Grok吐出什么;训练数据层的排除,管的是Grok学了什么。前者写得斩钉截铁,后者语焉不详——诉状正是咬住这道缝隙立论,这也是本案技术和法律层面最锋利的攻防点。

两层规则,一处缺口 生成端规则 CSAM绝对禁止 NSFW开启不例外 规则不可关闭 命中报告NCMEC 写得清楚 训练数据规则 暴力内容明确过滤 CSAM排除未见公开 NCII排除未见公开 NSFW排除未见公开 没写清楚

就算法院下令销毁,模型也未必忘得掉

Doe要求xAI销毁服务器上的Grok生成CSAM,并阻止Grok生成任何性化内容,连马斯克力推的"比基尼图"这类NSFW输出都在她要求叫停的范围里。她的律师团队认为,制作、持有、传播这三条罪名,xAI一条不少地占全了。

这个诉求听起来直接,执行起来却卡在一个行业性的技术空白上:一旦某个样本已经进入训练、更新了模型权重,想把它的影响完全从已训练模型里剥离出去,目前没有公开可用、可审计的方法。诉状自己也写道,取消已公开的图像,不代表它对模型的塑造作用也一并消失。法院可以下令删除服务器上的文件,却未必能命令一个已经训练好的模型"忘记"什么。

  • 提醒.公开发帖默认进训练库、关闭开关不彻底、生成物可能被回收训练——这三条不是xAI一家的特例,而是依赖用户生成内容训练模型的公司普遍采用的默认机制。这起案子如果坐实"默认训练即担责"的先例,受影响的不会只有一家公司。

X没有回应置评请求。案件还在最早期阶段,答辩还没提交——xAI打算承认哪部分训练数据来源、又会不会拿"技术上无法溯源、无法遗忘"当挡箭牌,是接下来最值得盯住的一步。孔子说"名不正则言不顺",这案子恰恰卡在"名"上:生成端的规矩写得明明白白,训练数据这一层,连自己都没说清楚拿什么当界限。