微软在和《纽约时报》等新闻出版商、作家团体的版权官司里,甩出了一组数字:820万条Copilot聊天记录,专门按关键词筛出来、"最可能涉及原告作品"的那批,里面只有5.95万条跟新闻内容有至少16个词重合,占比不到1%。微软想用这个数字证明一件事——Copilot很少原样复述新闻,更谈不上替代原文。但这最多反驳了"聊天机器人直接抄袭"的指控,回答不了"训练数据用得合不合法"这个更大的问题。

5.95万这个数字怎么来的

  • 微软向新闻出版商聘请的专家提供了820万条Copilot聊天记录,这批记录经过关键词筛选,专挑"最可能命中原告网站内容"的对话。
  • 分析结果.其中5.95万条至少有16个词,与训练时用来给模型"垫底"的新闻内容重合。
  • Center for Investigative Reporting的专家在这批数据里只找到51处"实质性重叠"。
  • 作家团体这边更极端.同样这8.2M条对话,专家只找到24条回复里有至少30个词的匹配;评估的212本书,只有10本出现过任何匹配。
  • 微软上周五提交这份文件,据此申请简易判决——如果法官同意,案子在早期阶段就直接终结。
  • 巧的是,特朗普政府本周也在《纽约时报》诉OpenAI案里提交了一份"利益声明",立场偏向OpenAI。
  • 截至发稿,《纽约时报》、CIR和作家协会都没有回应置评请求。
样本层层筛过,重合率仍不到1% 820万 经关键词筛选的 Copilot对话样本 5.95万 ≥16词与新闻重合 占比不到1% 24条 作家诉讼中 ≥30词匹配的回复

低复现率证明了什么,没证明什么

微软的逻辑很直白:Copilot极少一字不差吐出新闻原文,说明模型训练的"转换性目的"没被这点重复削弱——即便偶尔重复几句,也不妨碍训练本身构成合理使用。这是fair use四要素里最关键的一条,微软想用一个干净的数字把它坐实。

但这组数字有边界。样本是微软自己按关键词筛出来的、"最可能命中"的那批对话,不是随机抽样,复现率本该偏高;结果反而低到不到1%,对微软有利,但样本代表性怎么算,法庭上还得吵。匹配阈值定在16词、30词,门槛设在哪,直接决定命中多少条——往上提一点,数字就会更好看。更关键的是,训练阶段用没用这些作品、算不算合理使用,和产品输出端复不复现原文,本来就是两件事。前者关乎起点合不合法,后者只关乎结果像不像抄袭。微软现在交的是后一份答卷,却想让它替前一份答题。

出版商真正焦虑的,从来不是用户能不能从Copilot里粘出一整段《纽约时报》原文。他们担心的是,模型吃掉了自己几十年积累的内容,训练出能直接回答新闻问题、替代搜索和订阅的产品,这中间却没分一分钱。孟子那句"天下熙熙,皆为利来",放在这场官司上不是修辞——争的从来不是几个词的匹配率,是训练收益和分发权到底归谁。

复现率低,不等于训练用得干净。
  • 风险.这批数字来自微软自选样本与自设阈值,尚未经法院独立采信,不能当作侵权争议已经了结。

案子走到申请简易判决这一步,离真正开庭定谁对谁错还差得远。法官不买账,官司继续打;就算法官采信这批数字,也只解决了"产品像不像抄袭"这一小块——合理使用真正的核心争议,训练阶段的使用是否正当,仍然悬着没人回答。