7月21日,404 Media发现图书数据公司ISBNdb的网站上挂着一个奇怪的营销页面,标题是“为你的AI大语言模型数据集提供印刷书籍采购”。九天后,这个页面消失了,ISBNdb也换了一套说法:从未买过、扫过、卖过一本书,那只是一次“市场需求测试”。
真正值得追问的不是ISBNdb到底扫没扫过书——这件事目前只有一份被删除的营销页面和一次口径转变可以确认。更值得盯住的是,AI行业对“没被AI污染过”的干净纸质文本的胃口,正在把版权、二手书交易和“买下实体书就等于拿到训练权”之间的灰色地带,变成一门实实在在的生意。
九天,两套说法
7月28日,ISBNdb删除了那个页面,原标题是“Printed Books Sourcing for Your AI LLMs Dataset Needs”。两天后,公司在首页和新闻页贴出声明:从未购买、扫描或出售过一本书——无论是用于AI训练还是别的目的,“我们不训练AI模型,也从未训练过”,那个页面“只是一次市场兴趣测试,这项服务从未真正上线”。404 Media多次尝试联系ISBNdb置评,均未获回应。
对比被删除前的内容,反差不小。旧页面主张,2022年以前出版的书籍很少含有AI生成文本,拿来训练可以降低数据污染、预防“模型退化”的风险——这是ISBNdb自己的营销判断,不是被证实的技术结论。旧页面还写过,大规模从二手市场采购纸质书“不会剥夺任何创作者本该得到的收入”,“这些书已经完全履行了对创作者的经济义务”。它甚至提前承认了一个问题:如果扫描过程中大量销毁书籍被曝光,“‘AI公司销毁两百万本书’不是一个能引发同情的标题”。
纸书为什么突然值钱
放在更大的背景里看,这不是ISBNdb一家的孤立试水。今年1月,书籍作者对Anthropic提起版权诉讼,内部文件显示Anthropic计划采购并扫描数百万本印刷书籍,扫描后销毁原件;《华盛顿邮报》的调查进一步指出,这些书部分来自二手图书交易平台Better World Books。ISBNdb删除的营销材料,某种程度上是在给这门生意提前打预防针——先把“我们没有毁书”的说法准备好。
纸质书,正在被当成AI训练最后一块“干净”语料。
- 风险.书商反馈近期出现大量诡异订单,书目挑选毫无规律,报价还常常远高于市场价,像是买家不在乎钱只在乎数量。这只能说明有AI公司在批量收书,不能直接坐实买家就是ISBNdb或某家具体公司。
“测试市场需求”不是免责声明
“只是一次市场需求测试”,这句话听起来像撤退,其实更像行业心态的自白:纸质书市场正在被当成训练数据的洗白渠道来试探。买下一本实体书,拿到的只是这本书的所有权和二手转售权,不等于拿到数字化、复制、拿去训练模型的权利——这中间隔着版权法最基本的一道线。旧页面把“二手书已完成对创作者的经济义务”当作抗辩理由,恰恰绕开了这道线:创作者当年从首次销售中拿到的钱,从来没有覆盖“被扫描进AI模型”这一项。
- 结论.买下一本实体书,拿到的是物权和二手转售权,不是数字化和训练权——这条界线,才是整件事真正的赌注。
“天下熙熙,皆为利来;天下攘攘,皆为利往”,两千年前的判断放在今天的AI购书生意里依然成立。ISBNdb删了页面,退回到“只是测试”的说法,但驱动这门生意的逻辑没有变:作者和版权方要盯的是权利边界,二手书商要盯的是异常订单会不会再来一轮,AI公司要盯的是干净语料还能不能靠这条路径拿到手。删页容易,书商账本删不掉,这才是这条新闻真正留下的证据。
