Anna's Archive上周发了一篇措辞很重的博文:AI公司在秘密买书、扫描、销毁,只为拿到"2022年前、没被机器污染"的训练语料,还把这事定性成"合法但反人类的罪行"。文章拿出一个数字撑腰——15亿美元的版权和解。听起来像是AI公司为烧书付了一笔天价罚金。翻开法庭文件才发现,这笔钱赔的其实是另一批书。

Project Panama到底干了什么

法庭文件显示,Anthropic内部代号"Project Panama"的项目,从2024年初开始通过供应商大宗收购二手纸质书,方案里讨论过半年内处理50万到200万本的规模。书买回来,拆解、扫描、进训练库,原件销毁——这不是传闻,是诉讼里摆上桌面的操作细节。

省钱是真的:无损扫描要保留装订、不能拆页,成本比"扫完就扔"高得多。销毁掉,竞争对手拿不到同一批数据,还顺手降低了"留着侵权证据"的法律风险。三个动机都写在Anna's Archive自己的博文里,只是被扣了个"资本作恶"的帽子。

15亿美元赔的是另一批书

Anthropic确实付了15亿美元,针对约48万部作品,平均每部三千美元左右。但这笔钱不是为"买书销毁"埋单——它赔的是Anthropic此前从Books3、LibGen、PiLiMi等渠道下载并留存的至少700万本盗版电子书。这笔和解在2026年7月才拿到法院最终批准,连带要求销毁的是这批盗版数据集,不是被拆解掉的纸质书原件。

也就是说,"买书销毁"和"下载盗版"是两条完全不同的路,法院分别裁决,结论还相反:2025年6月的联邦裁决认定,把合法购买的纸质书转成内部数字副本、销毁纸质原件,属于合理使用,合法;下载留存盗版电子书,是侵权,才赔了钱。

两条路,两种判决 合法购书 扫描成数字副本 销毁纸质原件 法院认定:合理使用 2025年6月裁决,合法 下载盗版电子书 LibGen·PiLiMi等渠道 留存至少700万本 法院认定:侵权 15亿美元和解,2026年7月批准

Anna's Archive的博文把这两件事捏在一起讲,营造出"和解证明毁书有罪"的印象。法院实际给出的答案正好相反。

义愤可以真,事实不能乱炖。

"AI公司"不是一家公司

原文通篇用"AI公司们"这种复数,读者很容易以为整个行业都在批量买书拆书。目前公开的法庭证据里,真正被证实"买—拆—扫—销"这套完整链条的,只有Anthropic一家。

OpenAI的Books1、Books2语料集,Meta的Books3和LibGen下载,走的都是现成电子数据集的路子,没有同等规模的物理销毁记录浮出水面。Google Books反而是反例——从2004年起就用非破坏性扫描,扫完把书还给合作图书馆,书没少,只多了个数字副本。

谁被实证"买书销毁" Anthropic 实证 OpenAI 用现成数据集,无实证 Meta 用现成数据集,无实证 Google Books 非破坏性扫描,书归还图书馆 数据来源:法庭文件与公开报道,截至目前
  • 风险.一旦"合法购书销毁属合理使用"成为稳定判例,出版商和图书馆很难再靠法律挡住这类操作,能挡住的只剩市场手段——比如联合抬价、限制大宗收购。

Anna's Archive自己是谁

呼吁全球志愿者扫描上传书籍,听起来是在做"数字亚历山大图书馆"。但Anna's Archive本身是多国法院认定的影子图书馆,靠的就是持续吸纳新扫描资源续命。它喊"知识不该被私人服务器垄断",同时自己也在打造一个规模更大、法律地位同样模糊的私人资源库。

这不是说它说的没有道理——稀有书、绝版书一旦原件消失,确实再无重来的机会,这是真实存在、不可逆的损失。但读者该记住:呼吁者和被呼吁的对象,动机都不干净,谁都不是纯粹的"知识守护人"。

文章里那句"2025年起AI生成内容占新增网络内容一半以上",听起来很吓人,但检索不到一个独立可信的出处,更像是一句被反复转引、没人核实过的说法。用一个查无来源的数字去论证"人类文字即将被AI稀释",这本身就是需要警惕的传播套路。


古人说"其兴也勃焉,其亡也忽焉",用在这里未必贴切——纸质书的销毁不是文明的速朽,更像是资本在算一道成本账:无损扫描贵,销毁便宜,留证据有风险,三条理由都摆在明面上,不需要脑补出"反人类"的道德剧本。真正该盯住的,是判例往哪边走,不是情绪往哪边烧。