西雅图时报和 Newsday 已将 OpenAI 与微软告上法庭,指控两家公司未经许可使用其新闻内容训练 AI 模型,并在用户提问时复现报道原文。微软之所以被列为被告,是因为 Copilot 使用了 OpenAI 的技术。

这起诉讼的反常之处在于:西雅图时报此前曾参与过 OpenAI 支持的新闻相关项目,也拿过相应资助。但“接受资助”与“授权训练模型”是两份不同的文件、两种不同的权利。把它们混为一谈,会把真正的版权争议带偏。

西雅图时报与 Newsday 指控的核心,不是 AI 会不会写文章

两家媒体称,OpenAI 使用了它们的报道作为训练数据;在部分测试中,模型还会直接或近乎直接地输出报道内容。起诉材料提到,某些回答可以复现约 88 个单词的新闻原文。

这个数字本身还不能直接决定侵权成立。

法院通常要看几个问题:使用目的是否具有转换性,原作品属于事实性报道还是高度原创的表达,复制了多少内容,以及这种使用是否损害原有市场。88 个单词如果只是零散事实,和连续复现一段付费报道,法律意义并不相同。测试是在什么提示词、什么模型版本、什么访问条件下完成的,也会影响证据分量。

两家媒体还要求法院采取更严厉的措施,包括销毁涉及其内容的模型或相关训练材料。这个请求的现实难度很高。模型训练完成后,企业能否准确识别并删除某一家媒体的影响,和删除数据库里的一个文件不是一回事。法院即使认可部分侵权,也未必会直接命令销毁整个模型。

目前能确认的是,西雅图时报与 Newsday 加入了越来越长的原告名单。此前,纽约时报、Ziff Davis、Merriam-Webster 和 Encyclopaedia Britannica 等机构也曾就类似问题起诉 OpenAI;另有近 400 家地方报纸共同起诉 OpenAI 和微软。

这说明争议已经从“大媒体与 AI 公司之间的单案冲突”,变成了地方新闻行业的集体谈判。地方报纸手里的内容未必像全国性媒体那样有品牌溢价,却是城市交通、地方政府、学校和社区事件的主要信息来源。模型如果免费吸收这些报道,再把答案直接交给用户,媒体失去的可能不只是一次点击,还有订阅和广告之外的分发入口。

资助关系不能替代训练许可,真正的争议在合同和用途

西雅图时报曾获得 OpenAI 支持的新闻项目资助,这一点很容易被写成“昨天合作、今天起诉”的戏剧性故事。但从版权和商业合同看,两件事没有必然关系:

关系通常解决的问题能否自动授权模型训练
新闻项目资助支持研究、工具开发或行业合作不能
内容授权协议规定可使用的文章、场景、期限和价格需要看合同具体条款
公开网页访问允许公众在一定条件下阅读不等于允许批量训练和商业复制
AI 产品合作可能涉及展示、检索、署名或分成仍需明确写入训练及输出权限

所以,这起官司并不能简单归结为“收过对方的钱,后来反悔”。更准确的说法是:双方可能在新闻创新项目上有合作,但合作是否涵盖模型训练、检索增强和回答中的内容复现,要看具体协议和实际使用方式。

OpenAI 可能会主张,训练模型属于对公开信息的技术性处理,模型输出也不是简单复制原文;微软则可能争辩,Copilot 的生成、过滤和内容来源链条需要分别判断。原告则会强调,模型在特定提示下能够复现付费报道,已经触及替代原文阅读和新闻授权市场的问题。

这和传统搜索引擎并不完全一样。搜索引擎通常把用户带回原网页,媒体仍有机会获得访问量;如果 AI 助手直接给出完整答案,用户可能不再点击报道。对地方媒体而言,这个差别很实际:少一次点击,可能意味着少一次订阅转化,也可能让记者的报道更难被新读者发现。

最先感受到变化的,是地方媒体和依赖 AI 摘要的用户

地方媒体接下来大概率会更谨慎地处理 AI 合作。它们需要重新检查与模型公司签订的资助、数据、分发和内容合作协议,区分哪些内容可以被检索,哪些内容只能展示标题,哪些内容必须付费授权。

这会带来一个现实选择:

  • 如果媒体全面禁止抓取,短期内能减少未经许可的内容使用,但也可能失去 AI 搜索带来的曝光;
  • 如果接受一次性资助或低价授权,收入来得更快,却可能把长期内容价值锁在不透明的合同里;
  • 如果要求按检索量、订阅转化或收入分成计费,谈判周期会更长,技术核算也更复杂。

普通用户的变化则可能更隐蔽。依赖 Copilot 或其他 AI 工具查询地方新闻的人,未来可能看到更短的摘要、更少的原文片段,或者更多指向媒体网站的链接。回答质量是否下降,取决于平台能否用合法授权内容补上缺口,而不是简单地把所有新闻网站都排除在外。

这也是这类诉讼最重要、却最容易被忽略的限制:版权诉讼不会自动建立新的商业模式。即使媒体赢得案件,平台仍需要知道该向谁付钱、按什么口径计费、哪些内容可以使用,以及怎样证明模型没有复现原文。媒体也必须回答另一个问题:如果 AI 不再免费取用,用户是否愿意为这些地方新闻单独付费。

接下来最该看的,不是双方在发布会上谁的措辞更强硬,而是三组证据:

  1. 起诉材料能否证明模型在稳定条件下重复输出受版权保护的表达而不是偶尔生成相似句子;
  2. 被告能否拿出清晰的训练数据来源、过滤机制和内容授权记录;
  3. 法院如何区分“训练行为”和“输出行为”以及微软在 Copilot 产品链条中承担多大责任。

这场诉讼最终可能不会给出一个简单的“AI 训练合法”或“新闻内容禁止训练”的答案。更可能出现的结果,是法院把可接受的训练、可接受的摘要和不可接受的原文复现分开处理。对媒体和 AI 公司来说,真正昂贵的部分也许不是赔偿,而是从此必须把数据来源、使用范围和收益分配写进合同。