404 Media在一本稀有书里塞了追踪器,跟着它的物流轨迹,最终把定位锁在了内华达州拉斯维加斯的亚马逊仓库,内部代号VGT3。跟踪结果显示,这批书被拆掉装订、快速扫描,原书报废,扫描内容进了亚马逊的AI训练体系。
这不是"用书训练AI"第一次被曝光,扎眼的是拆装订这一步——书脊一旦被切开,稀缺版本就再也回不到原样。亚马逊选了最快也最不可逆的处理方式,而不是其他仍能保留原书的做法,这也是这次报道值得细看的地方。
追踪一本书,查到了什么
404 Media的方法很直接。他们在一本稀有书里放了追踪器,最终定位到亚马逊内华达州拉斯维加斯仓库,内部代号VGT3。在那里工作的亚马逊员工告诉记者,收到的书会先被切掉装订,方便机器批量扫描,原书随后报废。
报道没有点出具体书名,只提到这批书"稀有"——有的印量本来就少,有的是小语种,市面流通的本数屈指可数。一位向亚马逊卖书的书商告诉记者,这些书未必值钱,但历史价值、学术价值和情感价值,AI公司通常不太在意。
需要说清楚的是,404 Media目前公开的只是一次追踪结果和几名仓库员工的说法。报道没有交代亚马逊一共买了多少书、VGT3每天处理多少本、这些内容占训练数据的比例。亚马逊方面也没有被报道引用正式回应——这更像是撕开了一个口子,不是完整拼图。
拆书不是唯一选项
把书拆开扫描,亚马逊不是第一个这么干的机构。三条路线摆在一起看,能看出处理方式在变:
| 机构/项目 | 时间 | 处理方式 | 原书命运 |
|---|---|---|---|
| Internet Archive | 1996年创立 | 逐页扫描,不切装订 | 原书基本保留可读 |
| Google Books | 2004年启动 | 规模化扫描,曾因拆书引发版权诉讼 | 部分原书受损,具体比例未披露 |
| 亚马逊VGT3 | 本次报道披露 | 先切除书脊再扫描 | 原书报废 |
Google Books当年的扫描方式确实引发过旷日持久的版权官司,最终多以"合理使用"结案,但公开报道中对其是否普遍拆解装订说法不一,这里只作路线参照,不做严格技术对照。
三条路线摆在时间线上,越晚出现的项目,越倾向于牺牲原书换速度。这不代表亚马逊技术上做不到更细致的处理,而是优先级变了——省时间比保留实物更重要。
合理使用之外,谁该现在做决定
原报道用了"IP theft"(知识产权盗窃)来形容这件事,这是记者和受访书商的判断,不是法院的结论。亚马逊买下一本书的所有权,不等于自动拥有复制其文本内容的版权许可——这是版权法里"物权"和"版权"的基本区别。
大规模买书、拆书、扫描去训练模型,能不能被"合理使用"覆盖,要看具体案件里对使用目的、作品性质、使用比例、市场影响这四个因素的认定,现在还没有答案。
版权判断之外,还有一层不用打官司也能看清的损失:稀有书一旦被拆,物理原件就没有了。这跟Google Books、Internet Archive当年的争议不完全一样——那两家至少保留了原书的可读性,亚马逊这次连"书还在"这条底线都没有守住。
合理使用能不能成立,和稀有书还回不回得来,是两件事。
| 人群 | 现实处境 | 现在能做的事 |
|---|---|---|
| 稀有书收藏者、书商 | 卖出后书可能被拆,原件不可逆消失 | 卖书前问清买家用途,合同里加"不得拆解"条款——具体能否落地,还要看交易渠道 |
| 作者、出版方 | 作品文本可能进入Nova系列训练数据 | 跟踪自己作品是否被用于训练,关注亚马逊是否会有官方说明 |
| 图书馆、数字保存机构 | 靠塞追踪器查出问题的方法难以规模复制 | 推动更透明的采购和处理记录,而不是等下一次意外曝光 |
接下来最值得盯的,是亚马逊会不会正式回应,以及有没有权利人真的把这套训练流程告上法庭。
