一位不愿具名的外文旧书商说,从今年4月起,他的订单量从每周约20本涨到数百本。买家身份不明,挑书也没有主题规律——贵一点、冷一点都照单全收。
这类反常订单,被业内解读为AI公司在囤积"干净"的纸质书。图书数据库公司ISBNdb公开宣称,能为AI实验室单笔采购1000到100万册纸质书,还用保密协议把买家身份藏起来。纸书买得再多,也换不来版权争议的清场。
发生了什么:ISBNdb称单笔最高包销100万册,买家身份靠NDA藏住
这位书商遇到的情况,不是孤例。
ISBNdb在自己的博客里说得很直白:网络上能抓到的文本,越来越多混着AI生成内容。模型反复吃自己生成的东西,业内担心的现象是"模型崩溃"——练得越多,错得越多。
2022年之前出版的印刷书,出版时大模型还没普及,被业内视为大概率没被AI内容污染。这解释了书商观察到的怪现象:买家不挑主题、不问价格,他们要的不是某个领域的知识,而是"人写的、没被AI污染过"这个属性本身。
代价也摆在明面上:网络抓取几乎零成本,纸质书要一本本扫描,人力和设备都要花钱。这笔账,AI公司算过,还是觉得划算。
为什么重要:洁净数据解决不了版权问题,毁书扫描也不是标配流程
Anthropic是这场旧书采购里,唯一被坐实的案例。授权文件显示,它曾批量采购并扫描数百万册纸质书。承包商之一Datamation同时提供破坏性和非破坏性两种扫描服务——破坏性扫描要先拆书脊,更快也更便宜。
联邦法官William Alsup在Anthropic版权案里认定,这类做法属于合理使用。理由是纸质原件被数字副本"替换"而非"复制",而且没证据显示副本被对外分享。这个裁决只针对"买断纸书、数字化、销毁原件"这一套具体操作,不是版权豁免的通行证。
| 边界 | 已被认定的部分 | 仍然悬空的部分 |
|---|---|---|
| Anthropic案 | 买断纸书→数字化→销毁原件,属合理使用 | 不覆盖网络抓取来的盗版电子书 |
| 适用范围 | 仅限"替换"性质的内部数字化 | 不代表所有版权文本训练都合法 |
| 最新变量 | — | 据报道,2026年7月出版商已就Gemini训练起诉Google |
对AI公司来说,这意味着一件事:买纸书能拿到干净数据,拿不到版权免责。训练团队如果把"纸书=零风险"写进预算,这笔账算错了方向。
谁受影响:外文旧书商吃到订单,孤本和馆藏首当其冲
不止一位书商发现异常。Alibris论坛上有卖家说,"AutoBuy"订单从去年底开始猛增,平台客服的解释是"来了几个新的大批量买家"。另一家平台Biblio,直接让客户上传ISBN清单批量下单。荷兰媒体今年6月采访的多位稀缺书商,也提到同样的批量采购模式。
没有一个平台或书商能证实买家就是AI公司。这些推测,全部来自订单本身的反常之处:学校和图书馆的采购预算普遍在缩水,可这批订单不挑主题、不在乎价格——不像传统买家的行事逻辑。
旧书商这边,眼前是真金白银:订单涨了,冷门外文书也能出手。图书馆和孤本收藏机构这边,风险更实际:稀缺版本一旦被拆脊扫描后销毁,市面上可能就再找不到第二本。手里有稀缺外文旧书的机构,这时候更该优先做数字化备份,别等着被动等买家上门。
接下来能验证这套推测的,是有没有更多书商愿意具名证实同样的订单模式,以及纸质书采购会不会像Google一样,被卷进新的版权诉讼。
