爱尔兰书店Kennys最近收到一笔怪订单:5000本互不相关的冷门旧书,买家一句价都没还。店主Tomás Kenny的反应不是高兴,是警觉。正常读者挑一两本会砍价,图书馆批量采购也会压价,唯独不在乎价格、也不挑品种的买家,通常是要拿去批量扫描的。
Kennys最后把这单拒了。这事发生在书商圈刚经历一轮"AI买书"恐慌之后——去年一场诉讼把Anthropic代号"Project Panama"的拆书扫描项目摆上台面,书商们从此看谁都像AI公司的采购员。
发生了什么,证据到哪一步
- Anthropic那场诉讼证实的是"拆书扫描"这件事本身发生过。没有证据显示扫描对象里包含无法复制的稀有本,Anthropic也公开否认过。
- xAI的马斯克在X上要求团队"逐页扫描,别直接切书脊",但没定义什么算稀有书,也没承诺绝不销毁。
- OpenAI和微软跟哈佛图书馆合作,用了约100万本15世纪以来的公版书训练模型,走的是保存路线,是正面案例。
- Kennys这单5000本订单,买家身份和用途至今没有第三方证实,目前只是"疑似"。
把这几条摆在一起,结论只能是审慎的:拆脊扫描这件事本身是真的,"AI公司系统性销毁稀有书"这个说法目前还停留在推测层面,没有坐实。真正被坐实的,是拆脊扫描比逐页保护式扫描便宜太多——这才是书商焦虑的根源。
两种扫描,谁在为"不可逆"买单
为什么这件事重要:拆脊扫描不可逆。一本孤本切开扫描完,原件可能就没了,再也印不出第二本。
互联网档案馆保存旧书靠人工逐页翻。扫描员一页一页手翻,机器抽真空的自动扫描仪碰到脆弱旧书容易直接碎裂,不适合稀有本。Google也有非破坏性扫描专利,理论上能不拆书就扫描,但速度慢、成本高,工人手速快了还会拍进手指。
三条路线摆在一起看更清楚:
| 方式 | 速度 | 成本 | 对原书的影响 | 代表案例 |
|---|---|---|---|---|
| 拆脊扫描 | 快 | 低 | 切断,不可逆 | 传闻中的AI训练采购 |
| 人工逐页扫描 | 慢 | 高,依赖人力 | 完整保留 | 互联网档案馆 |
| 非破坏性扫描 | 偏慢 | 较高 | 基本保留 | Google专利方案 |
三条路线技术上都存在,选哪条从来不是能力问题,是愿不愿意为一本不可再生的书多花时间和钱。
谁该盯着这件事,接下来看什么
这件事对两类读者意味着不同的动作。
关注AI训练数据伦理的人,该盯的不是又一条"我们不会毁书"的声明——声明便宜,第三方核实才值钱。真正值得追的是:有没有独立机构去核对某一批稀有书扫描后的实物去向,以及未来诉讼里会不会出现稀有本被销毁的实证。
关心图书保存和文化遗产的人,能做的更具体:手里有孤本、批注本或家族旧藏的,遇到大宗无议价收购先多问一句买家用途和最终去向;捐赠给图书馆或档案馆前,先确认对方走的是逐页扫描还是拆脊扫描。这不是专门防AI公司,是防任何一种以效率之名做的不可逆操作。
书商这轮警惕不是护书情结,是精明的风险判断。稀有书一旦被拆脊扫描完,原书残页可能直接进废纸厂,往后能卖的孤本就少一本。卖一单,可能断一条长期生意。
"稀有书"到现在也没有统一定义,xAI式的表态随时可以靠模糊边界打折扣——这才是这件事最悬而未决的地方。
