《西雅图时报》和 Newsday 成了最新一批把 OpenAI、微软告上法庭的新闻机构。它们指控两家公司未经许可使用新闻作品训练 AI,起诉材料还列出一段据称由 ChatGPT 复现的 88 个单词。
88 个单词很适合做标题,却不能替法院完成论证。
模型是否使用过涉案文章、训练行为是否构成合理使用、一次近似复现是否侵犯版权,是三道不同的题。现在能确认的是原告提出了指控,法院尚未认定这些主张成立。
88 个单词,只能推开第一扇门
这起诉讼的核心信息,可以压缩成下面几项:
| 问题 | 目前能确认什么 |
|---|---|
| 发生了什么 | 两家新闻机构起诉 OpenAI 和微软,指控其未经许可使用受版权保护的新闻内容 |
| 原告拿出了什么 | 起诉材料列举 ChatGPT 据称复现约 88 个单词的案例 |
| 争议在哪里 | 训练时是否复制作品、输出是否构成实质性相似、相关使用能否适用合理使用 |
| 案件到哪一步 | 仍处于诉讼阶段,起诉书是单方主张,不是法院结论 |
这里最容易混淆的,是把“模型输出过相似文字”直接写成“训练侵权已经坐实”。
输出案例确实有分量。它可能帮助原告证明模型存在记忆和复现现象,也可能支撑针对具体输出的侵权主张。但它不能单独回答训练阶段是否合法。美国法院审查合理使用时,还会看使用目的、使用数量、作品性质以及对原作市场的影响。
换句话说,88 个单词是一条证据线索,不是一锤定音。
robots.txt 也常被说得过于神奇。它主要是网站向自动抓取程序表达访问偏好的技术文件,并不天然等于版权许可,更不是一纸有明确效力的授权合同。忽略它可能影响法院对行为方式、主观状态或网站条款的判断,但“违反 robots.txt”与“构成版权侵权”不能直接画等号。
付费墙同样如此。公开网页不代表可以任意复制,付费内容也不会自动获得更高级别的版权保护。真正需要查清的是:内容如何取得、复制了多少、拿去做了什么,以及产品是否替代了原作。
至于媒体报道里常见的“天价索赔”,更不能拿作品数量简单相乘。最终赔偿还要看版权登记、作品计算方式、侵权认定和主观故意等问题。起诉书里的金额上限,离实际到账通常隔着漫长的证据程序。
搜索时代的旧交易,被生成式 AI 改坏了
过去二十年,媒体与搜索引擎之间有一笔不太体面、但还能运转的交易:搜索引擎索引内容,媒体换回点击和广告收入。
生成式 AI 改了这个结构。
用户问完问题,答案直接出现在对话框里。若摘要足够完整,原报道可能连一次点击都拿不到。新闻编辑部承担采访、核实和法律风险,平台拿走即时答案的价值。对地方媒体尤其如此,一篇调查报道可能耗费记者数周,模型压缩它只需几秒。
这也是媒体一边起诉、一边谈授权的原因。
| 路线 | 公开案例 | 媒体想得到什么 | 现实代价 |
|---|---|---|---|
| 诉讼 | 《纽约时报》于 2023 年起诉 OpenAI 和微软 | 赔偿、判例和更强的谈判筹码 | 周期长、成本高,结果存在不确定性 |
| 授权 | 美联社、英国《金融时报》、新闻集团先后与 OpenAI 达成合作 | 许可费、产品曝光和新的分发渠道 | 定价不透明,大平台仍掌握主要议价权 |
所以,把这场冲突解释成“传统媒体抵制新技术”,未免太省事。
媒体真正担心的,是内容从有价格变成默认免费。OpenAI 需要大量、可靠、持续更新的材料,新闻机构则希望自己的采编成本进入 AI 产品的成本表。双方争执的是谁来定价,以及用户得到答案后是否还需要回到原网站。
我更在意的,也正是这一点:搜索引擎至少曾经承诺带来流量,生成式 AI 则可能在不送出点击的情况下完成价值截取。旧交易已经松动,新交易却还没有公开价目表。
胜负不由口号决定,要看三类证据
接下来真正影响案件走向的,不是哪一方把声明写得更强硬,而是证据链是否完整。
| 观察变量 | 为什么重要 |
|---|---|
| 训练数据记录 | 能否证明涉案文章进入过训练集,以及通过何种渠道取得 |
| 输出复现条件 | 88 个单词是普通提问即可得到,还是依赖精心设计的提示词;能否稳定重复 |
| 市场替代证据 | 用户是否因 AI 答案减少访问、订阅或购买原报道 |
| 授权价格 | 同类媒体与 AI 公司已经签下的协议,可能成为衡量市场价值的参照 |
如果你经营媒体、通讯或专业内容网站,最现实的变化不是立刻收到授权费,而是先补证据:保存抓取日志,明确网站条款,记录异常访问,并整理作品登记和发布时间。没有这些材料,内容被用了也可能难以举证。
普通 ChatGPT 用户短期内大概率不会看到产品突然下线。更可能发生的是回答缩短原文复现、增加来源链接,部分高价值新闻转入授权内容池。若诉讼压力继续上升,免费而完整的新闻型回答会变少,平台也会更谨慎地处理付费报道。
这场官司未必会给所有训练数据划出一条清楚边界。它至少会逼 AI 公司回答一个长期被技术叙事掩住的问题:模型的能力来自海量内容,那么生产这些内容的人,究竟该拿到多少钱。
