一名书商在一批经Biblio平台成交、约1000册的稀有书大宗订单里悄悄塞了一枚AirTag。定位信号最终停在了拉斯维加斯一处仓库门口,门上贴着一只准备吞书的霸王龙图案——那是亚马逊内部代号VGT3的AI训练数据团队。404 Media在8月17日的报道里证实,这支团队的日常工作就是把书从装订处撕开、逐页高速扫描,然后处置原书。书商圈子怀疑了一年多的事,第一次有了实锤。
亚马逊对此的回应是一句放之四海皆准的话:“亚马逊通过商业渠道购买书籍,以帮助开发和改进客户使用的产品和服务。”这份声明只字不提AI训练、不提模型名字、不提扫描件如何留存,也不解释为什么要拆书。比起“毁书”这个动作本身,这种刻意的语焉不详,才是这件事里最值得记一笔的地方。
拆书这件事,法律上其实没那么简单也没那么违法
很多人第一反应是这算不算侵权。答案没那么戏剧化。Anthropic此前被曝出的“Project Panama”项目走的是同一套流程:批量购书、拆装订、扫描、处置纸质原件。2025年6月23日,联邦法院对此给出裁决:购买合法纸质书、转成内部数字替代品并销毁纸质原件,属于合理使用(fair use);但如果训练库里混入了盗版电子书,就不受保护——Anthropic后来就盗版部分支付了15亿美元和解金。
也就是说,销毁书籍这个动作本身不是被法院要求的义务,而是一种论证策略:只要没有新增流通副本,就更容易被认定为“合理使用”。这给了亚马逊一个现成的法律框架去躲,但不代表它自动免责——法院判的是Anthropic的具体行为,不是给整个行业发的通行证。
“稀有书”被销毁,听起来比实际情况更耸动
新闻标题里的“rare books”容易让人联想到手抄珍本、初版孤本。404 Media的调查其实说得更精确:这批被盯上的书大多是流通量极低的绝版书、从未被译成主流语言的外语书、或印量小到从未广泛发行的作品,而不是收藏市场上标价高昂的珍本初版。
结论:书商在意的“稀有”是历史和情感价值,AI公司要的只是没被互联网爬过的干净文本,两套标准根本不是一回事。
Reddit上的争论正好卡在这个错位上。有人说“你反正也不会买那本1700年的旧书”,原帖作者反驳:AI公司扫描后从不公开内容,书里能被人重新发现的细节,会随着原书销毁而二次消失。双方吵的不是同一个问题——一个在算经济账,一个在算文化账。
三家公司的透明度落差,比“销毁”本身更说明问题
同样在争夺稀有文本,Anthropic、xAI、Amazon走的是三条不同的路。Anthropic因为吃了官司,被迫在法庭文件里交代购书、拆书、扫描的完整流程;xAI只有马斯克口头说过会保留稀有书、用非破坏性方式扫描,但至今没有任何可审计的采购记录支撑这个承诺;亚马逊夹在中间,声明里连“AI训练”四个字都不提。
- 提醒.三家公司中,亚马逊是唯一一个连“用于AI训练”都不肯承认的,这在数据溯源上是最不透明的一档。
书源枯竭,才是更结构性的信号
VGT3的员工在论坛里透露过一个细节:今年早些时候,仓库的书源一度完全断供,工人担心据点会因此关停。这不是一句抱怨,而是一个产业信号——未被互联网爬取过的原创干净文本正在变得稀缺,稀缺到需要靠系统性买断绝版书库存来维系供给。
员工被要求先扫ISBN条码再扫内容,这印证了书商此前的猜测:AI公司很可能在按已编目图书清单往下啃,目标是穷尽全球已出版的独特文本,而不是挑选真正有价值的版本。
训练数据快见底时,行业默认的解法是拆掉全球绝版书库存
对书商来说,这是一个矛盾的旺季:大宗订单带来了历史性的销售数字,但每卖出一批,市场上可供后人查阅的实体存量就少一批。对于像Scottish书商Derek Walker这样的人而言,真正的红线不是“这本书是否稀有”,而是“这本书是不是某个版本仅存的最后一本”——目前没有任何一家AI公司公开承诺会去做这种甄别。
接下来值得盯的,是亚马逊会不会像Anthropic一样,因为诉讼被迫公开更多细节;以及书商和图书馆界能不能在被买空之前,谈出一套“先数字化留档、再决定是否出售原件”的行业规则。
