爱尔兰书店Kennys最近收到一笔怪订单:5000本互不相关的冷门旧书,买家一句价都没还。店主Tomás Kenny的反应不是高兴,是警觉。正常读者挑一两本会砍价,图书馆批量采购也会压价,唯独不在乎价格、也不挑品种的买家,通常是要拿去批量扫描的。

Kennys最后把这单拒了。这事发生在书商圈刚经历一轮"AI买书"恐慌之后——去年一场诉讼把Anthropic代号"Project Panama"的拆书扫描项目摆上台面,书商们从此看谁都像AI公司的采购员。

发生了什么,证据到哪一步

  • Anthropic那场诉讼证实的是"拆书扫描"这件事本身发生过。没有证据显示扫描对象里包含无法复制的稀有本,Anthropic也公开否认过。
  • xAI的马斯克在X上要求团队"逐页扫描,别直接切书脊",但没定义什么算稀有书,也没承诺绝不销毁。
  • OpenAI和微软跟哈佛图书馆合作,用了约100万本15世纪以来的公版书训练模型,走的是保存路线,是正面案例。
  • Kennys这单5000本订单,买家身份和用途至今没有第三方证实,目前只是"疑似"。

把这几条摆在一起,结论只能是审慎的:拆脊扫描这件事本身是真的,"AI公司系统性销毁稀有书"这个说法目前还停留在推测层面,没有坐实。真正被坐实的,是拆脊扫描比逐页保护式扫描便宜太多——这才是书商焦虑的根源。

两种扫描,谁在为"不可逆"买单

为什么这件事重要:拆脊扫描不可逆。一本孤本切开扫描完,原件可能就没了,再也印不出第二本。

互联网档案馆保存旧书靠人工逐页翻。扫描员一页一页手翻,机器抽真空的自动扫描仪碰到脆弱旧书容易直接碎裂,不适合稀有本。Google也有非破坏性扫描专利,理论上能不拆书就扫描,但速度慢、成本高,工人手速快了还会拍进手指。

三条路线摆在一起看更清楚:

方式速度成本对原书的影响代表案例
拆脊扫描切断,不可逆传闻中的AI训练采购
人工逐页扫描高,依赖人力完整保留互联网档案馆
非破坏性扫描偏慢较高基本保留Google专利方案

三条路线技术上都存在,选哪条从来不是能力问题,是愿不愿意为一本不可再生的书多花时间和钱。

谁该盯着这件事,接下来看什么

这件事对两类读者意味着不同的动作。

关注AI训练数据伦理的人,该盯的不是又一条"我们不会毁书"的声明——声明便宜,第三方核实才值钱。真正值得追的是:有没有独立机构去核对某一批稀有书扫描后的实物去向,以及未来诉讼里会不会出现稀有本被销毁的实证。

关心图书保存和文化遗产的人,能做的更具体:手里有孤本、批注本或家族旧藏的,遇到大宗无议价收购先多问一句买家用途和最终去向;捐赠给图书馆或档案馆前,先确认对方走的是逐页扫描还是拆脊扫描。这不是专门防AI公司,是防任何一种以效率之名做的不可逆操作。

书商这轮警惕不是护书情结,是精明的风险判断。稀有书一旦被拆脊扫描完,原书残页可能直接进废纸厂,往后能卖的孤本就少一本。卖一单,可能断一条长期生意。

"稀有书"到现在也没有统一定义,xAI式的表态随时可以靠模糊边界打折扣——这才是这件事最悬而未决的地方。

两种扫描,两种代价 拆脊扫描 速度:快 成本:低 原书:切断,不可逆 稀有本:一去不返 传闻中的AI训练采购 逐页人工扫描 速度:慢 成本:高,依赖人力 原书:完整保留 稀有本:可反复复用 互联网档案馆方式