404 Media在一本稀有书里塞了个追踪器,看着它一路开进拉斯维加斯一座代号VGT3的仓库——门口标志是一只恐龙抱着一本书。书进去之后,书脊被切掉,内容被扫描,原书大概率进了碎纸机。这家仓库属于亚马逊

亚马逊的回应是一句标准公关话:"通过商业渠道购买书籍,以改善客户使用的产品和服务。"这话没说谎,但也几乎什么都没说。真正有意思的不是"大厂拆书"这个猎奇细节,而是这套流程,几乎是照着去年一桩判决书原样抄下来的。

发生了什么

  • .亚马逊,通过VGT3仓库处理购入的稀有/绝版书籍
  • 怎么做.拆书脊→扫描全文→原书大概率销毁→保留一份数字副本
  • 证据.404 Media在书里植入追踪器,证实流向该仓库
  • 官方口径.亚马逊承认购书,但只说"改善产品服务",不提训练AI三个字

为什么偏偏挑绝版书

互联网上能爬的文本,大模型公司早就爬得差不多了。剩下的高质量语料,越来越稀薄。

更麻烦的是模型崩溃风险:如果训练数据里混进太多AI生成的文本,模型输出质量会一代代变差。2022年之前出版、从没被数字化的稀有书,是少数能确定"绝对不是AI写的"干净语料——这正是它们突然变得抢手的原因。

这套流程不是亚马逊发明的

一年多前的Bartz v. Anthropic案,给整个行业写好了操作手册。法院裁定:Anthropic购买纸质书、拆装订、扫描、销毁原件、只留一份私人数字副本的"一对一格式转换",构成合理使用;但它另外用来训练模型的盗版书库,不受这个豁免保护。

亚马逊现在做的事,和判决书里被认可的那一半,几乎一模一样。这不是巧合,更像是一份被验证过、法律风险最低的合规剧本,被直接拿来复用。

Bartz案剧本:亚马逊的操作五步 购买 实体书 拆书脊 扫描 销毁原件 留一份 数字副本 Bartz案认定:上述五步的"一对一格式转换"属合理使用 未回答:这份数字副本被用来训练商业模型,是否同样受保护

物权、版权、扫描件版权,是三件事

买下一本书,你拥有的是物权——可以撕、可以烧、可以卖,这是"首次销售原则"给的自由。

但物权不等于版权。书里的文字表达,版权仍归作者或出版商所有,不会因为你买了纸质书就自动转移给你。扫描这个动作,本身就在动版权人的复制权。

  • 风险.亚马逊"合法购买"的表态,只解决了物权层面的问题,训练环节本身是否构成合理使用,还是一个独立的、没有定论的法律问题。

对照案例能看出边界具体在哪。Kadrey v. Meta案里,法院认定Meta训练用途合理,理由是原告没能拿出足够的市场稀释证据——法院也明说,证据更充分的话结果可能不同。Authors Guild v. Google案里,谷歌扫描全书被认定合理使用,前提是它只做搜索和"片段展示",不是无限制生成竞争性内容。美国版权局2025年的报告态度也很谨慎:非商业、非替代性的使用更容易过关;用非法来源的作品做商业性生成训练,更难被认定合理。

亚马逊的做法,恰好卡在这几条边界的中间地带:购买渠道合法,用途却是商业性的生成式训练——离Google Books的"搜索豁免"有距离,离Bartz案里被明确否定的"盗版书库"也有距离。

销毁原件洗不白后续的训练用途,这两件事在法律上从来是分开算的。

谁会被这事牵连

稀有书商和藏书界首当其冲——大规模收购可能推高孤本、绝版书的价格,加速一部分实体书从市场上消失。作者、出版商和版权继承人是被原文完全没提到的一方,他们的作品可能正在被商业训练吃掉,而Bartz案已经证明,这条诉讼路径是走得通的。图书馆和文献保护机构,则更在意这种"为了扫描而销毁"本身的伦理问题——古籍一旦拆了,就回不去了。

接下来值得盯的,不是亚马逊会不会道歉,而是这几件事:项目规模到底多大,扫描件最终喂给了哪个具体模型,有没有版权方对着VGT3提起下一场Bartz式诉讼。恐龙抱着书的标志挺讽刺——一家靠卖书起家的公司,现在靠拆书续命自己的AI。判决书能不能真的兜住这套操作,现在还没人知道。