Anna's Archive上周发了一篇措辞很重的博文:AI公司在秘密买书、扫描、销毁,只为拿到"2022年前、没被机器污染"的训练语料,还把这事定性成"合法但反人类的罪行"。文章拿出一个数字撑腰——15亿美元的版权和解。听起来像是AI公司为烧书付了一笔天价罚金。翻开法庭文件才发现,这笔钱赔的其实是另一批书。
Project Panama到底干了什么
法庭文件显示,Anthropic内部代号"Project Panama"的项目,从2024年初开始通过供应商大宗收购二手纸质书,方案里讨论过半年内处理50万到200万本的规模。书买回来,拆解、扫描、进训练库,原件销毁——这不是传闻,是诉讼里摆上桌面的操作细节。
省钱是真的:无损扫描要保留装订、不能拆页,成本比"扫完就扔"高得多。销毁掉,竞争对手拿不到同一批数据,还顺手降低了"留着侵权证据"的法律风险。三个动机都写在Anna's Archive自己的博文里,只是被扣了个"资本作恶"的帽子。
15亿美元赔的是另一批书
Anthropic确实付了15亿美元,针对约48万部作品,平均每部三千美元左右。但这笔钱不是为"买书销毁"埋单——它赔的是Anthropic此前从Books3、LibGen、PiLiMi等渠道下载并留存的至少700万本盗版电子书。这笔和解在2026年7月才拿到法院最终批准,连带要求销毁的是这批盗版数据集,不是被拆解掉的纸质书原件。
也就是说,"买书销毁"和"下载盗版"是两条完全不同的路,法院分别裁决,结论还相反:2025年6月的联邦裁决认定,把合法购买的纸质书转成内部数字副本、销毁纸质原件,属于合理使用,合法;下载留存盗版电子书,是侵权,才赔了钱。
Anna's Archive的博文把这两件事捏在一起讲,营造出"和解证明毁书有罪"的印象。法院实际给出的答案正好相反。
义愤可以真,事实不能乱炖。
"AI公司"不是一家公司
原文通篇用"AI公司们"这种复数,读者很容易以为整个行业都在批量买书拆书。目前公开的法庭证据里,真正被证实"买—拆—扫—销"这套完整链条的,只有Anthropic一家。
OpenAI的Books1、Books2语料集,Meta的Books3和LibGen下载,走的都是现成电子数据集的路子,没有同等规模的物理销毁记录浮出水面。Google Books反而是反例——从2004年起就用非破坏性扫描,扫完把书还给合作图书馆,书没少,只多了个数字副本。
- 风险.一旦"合法购书销毁属合理使用"成为稳定判例,出版商和图书馆很难再靠法律挡住这类操作,能挡住的只剩市场手段——比如联合抬价、限制大宗收购。
Anna's Archive自己是谁
呼吁全球志愿者扫描上传书籍,听起来是在做"数字亚历山大图书馆"。但Anna's Archive本身是多国法院认定的影子图书馆,靠的就是持续吸纳新扫描资源续命。它喊"知识不该被私人服务器垄断",同时自己也在打造一个规模更大、法律地位同样模糊的私人资源库。
这不是说它说的没有道理——稀有书、绝版书一旦原件消失,确实再无重来的机会,这是真实存在、不可逆的损失。但读者该记住:呼吁者和被呼吁的对象,动机都不干净,谁都不是纯粹的"知识守护人"。
文章里那句"2025年起AI生成内容占新增网络内容一半以上",听起来很吓人,但检索不到一个独立可信的出处,更像是一句被反复转引、没人核实过的说法。用一个查无来源的数字去论证"人类文字即将被AI稀释",这本身就是需要警惕的传播套路。
古人说"其兴也勃焉,其亡也忽焉",用在这里未必贴切——纸质书的销毁不是文明的速朽,更像是资本在算一道成本账:无损扫描贵,销毁便宜,留证据有风险,三条理由都摆在明面上,不需要脑补出"反人类"的道德剧本。真正该盯住的,是判例往哪边走,不是情绪往哪边烧。
