404 Media在一本稀有书里塞了追踪器,跟着它的物流轨迹,最终把定位锁在了内华达州拉斯维加斯的亚马逊仓库,内部代号VGT3。跟踪结果显示,这批书被拆掉装订、快速扫描,原书报废,扫描内容进了亚马逊的AI训练体系。

这不是"用书训练AI"第一次被曝光,扎眼的是拆装订这一步——书脊一旦被切开,稀缺版本就再也回不到原样。亚马逊选了最快也最不可逆的处理方式,而不是其他仍能保留原书的做法,这也是这次报道值得细看的地方。

追踪一本书,查到了什么

404 Media的方法很直接。他们在一本稀有书里放了追踪器,最终定位到亚马逊内华达州拉斯维加斯仓库,内部代号VGT3。在那里工作的亚马逊员工告诉记者,收到的书会先被切掉装订,方便机器批量扫描,原书随后报废。

报道没有点出具体书名,只提到这批书"稀有"——有的印量本来就少,有的是小语种,市面流通的本数屈指可数。一位向亚马逊卖书的书商告诉记者,这些书未必值钱,但历史价值、学术价值和情感价值,AI公司通常不太在意。

需要说清楚的是,404 Media目前公开的只是一次追踪结果和几名仓库员工的说法。报道没有交代亚马逊一共买了多少书、VGT3每天处理多少本、这些内容占训练数据的比例。亚马逊方面也没有被报道引用正式回应——这更像是撕开了一个口子,不是完整拼图。

亚马逊VGT3仓库处理流程 购书 向书商采购 包括稀有书 拆装订 切除书脊 原书报废 扫描 机器批量 加速处理 训练Nova 文本进入 AI训练数据

拆书不是唯一选项

把书拆开扫描,亚马逊不是第一个这么干的机构。三条路线摆在一起看,能看出处理方式在变:

机构/项目时间处理方式原书命运
Internet Archive1996年创立逐页扫描,不切装订原书基本保留可读
Google Books2004年启动规模化扫描,曾因拆书引发版权诉讼部分原书受损,具体比例未披露
亚马逊VGT3本次报道披露先切除书脊再扫描原书报废

Google Books当年的扫描方式确实引发过旷日持久的版权官司,最终多以"合理使用"结案,但公开报道中对其是否普遍拆解装订说法不一,这里只作路线参照,不做严格技术对照。

三种数字化路线 1996-2026 1996 Internet Archive 逐页扫描 不切装订 2004 Google Books 切割书脊 追求速度 2026 Amazon VGT3 拆书扫描 原书销毁

三条路线摆在时间线上,越晚出现的项目,越倾向于牺牲原书换速度。这不代表亚马逊技术上做不到更细致的处理,而是优先级变了——省时间比保留实物更重要。

合理使用之外,谁该现在做决定

原报道用了"IP theft"(知识产权盗窃)来形容这件事,这是记者和受访书商的判断,不是法院的结论。亚马逊买下一本书的所有权,不等于自动拥有复制其文本内容的版权许可——这是版权法里"物权"和"版权"的基本区别。

大规模买书、拆书、扫描去训练模型,能不能被"合理使用"覆盖,要看具体案件里对使用目的、作品性质、使用比例、市场影响这四个因素的认定,现在还没有答案。

版权判断之外,还有一层不用打官司也能看清的损失:稀有书一旦被拆,物理原件就没有了。这跟Google Books、Internet Archive当年的争议不完全一样——那两家至少保留了原书的可读性,亚马逊这次连"书还在"这条底线都没有守住。

合理使用能不能成立,和稀有书还回不回得来,是两件事。
人群现实处境现在能做的事
稀有书收藏者、书商卖出后书可能被拆,原件不可逆消失卖书前问清买家用途,合同里加"不得拆解"条款——具体能否落地,还要看交易渠道
作者、出版方作品文本可能进入Nova系列训练数据跟踪自己作品是否被用于训练,关注亚马逊是否会有官方说明
图书馆、数字保存机构靠塞追踪器查出问题的方法难以规模复制推动更透明的采购和处理记录,而不是等下一次意外曝光

接下来最值得盯的,是亚马逊会不会正式回应,以及有没有权利人真的把这套训练流程告上法庭。