全球书商都收到异常订单
在英国诺森伯兰郡经营巴特书店的斯图尔特·曼利,过去每周通常能卖出两三千本二手书。但最近,一家加拿大公司下的一笔订单就相当于他整整一周的销量。他表示,自己在二手书行业从业30年来,从未见过如此异常的大宗采购。
美国休斯顿贝克书店的经理查理·贝克称,近期他卖给同一位买家95本书,其中一笔订单就达70本。订单中的书几乎全部为非虚构类作品,大多出版于20世纪70年代至90年代,例如一本1995年出版的《丹佛都市区内幕指南》。
爱尔兰的肯尼斯书店也曾收到一笔5000本图书的大订单,书目涵盖地方历史、18世纪非洲农具研究、20世纪50年代赛车手传记,以及十分冷门的金融指南,几乎看不出任何选书规律,像是由机器自动生成的采购清单。
因此,不少书商开始怀疑,这些买家可能并非普通读者,而是通过自动化系统依据国际标准书号(ISBN)搜寻尚未被AI训练数据覆盖的图书资源。
三个月前,一位用户在知名社交媒体平台上发问:“最近二手书在网上被疯狂抢购,到底发生了什么?”这条帖子很快获得大量回复,不少自称书商的用户纷纷分享自己收到异常大批量订单的经历。
而这些采购者中,很多其实是中间商,并不直接属于AI公司。总部位于加拿大的Zoom Books自称是“北美领先的图书回收公司”,依靠“智能物流”每月“采购、分类和转售超过200万册图书”。德国、新西兰等多个国家的书商都曾收到这家企业的订单。
在荷兰,一些书商还收到了来自一家名为“2077AI”的新加坡机构的电子邮件。该机构声称正在“革新人工智能数据”,其业务之一就是建立训练数据集。该公司发出的邮件中附带了一份包含3000种英文图书的书单,其中包括《地质力学中的离散元建模》等学术类著作。
这一现象对出版行业而言,已经成为当下最受关注的热门议题之一。一位不愿透露姓名的英国二手书商指出,虽然订单来自不同买家,但货物最终都被运往同一个地址。自今年1月以来,他已接到类似买家订购的6000本书,价值数千英镑。这些买家不仅批量采购,出价还“非常高”,而且从不要求折扣。
这一连串异常订单引发了书商们的广泛猜测,很多人认为,人工智能公司正在大规模收购书籍,扫描内容用于AI模型训练,随后再将纸质书销毁。
美国法官判决购买书籍训练不违法
2025年,在三位作家起诉人工智能公司Anthropic的版权案件中,法官裁定,以购买书籍的方式训练人工智能软件并不违反美国版权法。原因在于,这些模型是以“变革性使用”的方式处理书籍内容,人工智能训练过程被类比为教师“训练小学生写作”。
▲一个用于Anthropic公司“巴拿马计划”的二手书仓库
法庭文件显示,Anthropic曾斥资数千万美元收购数百万本图书,拆除书脊、扫描书页,用于训练其大语言模型Claude。该项目在公司内部被称为“巴拿马项目”。被拆解扫描的书籍种类十分广泛,从冷门的拉丁文文献到西部牛仔小说均包含在内。
对此,Anthropic回应称,从书籍中寻找模型训练素材,是人工智能行业普遍采用的做法,公司相关数据采集项目不会“购买和销毁珍稀古籍”。
在另一起诉讼中,Anthropic还被指从盗版网站下载了大量电子书用于训练模型。在该案中,Anthropic没有承认存在不当行为,而是同意向出版商和作者支付15亿美元和解金,以避免进入审判程序。其间,被下载作品的作者可以申请和解赔偿,预计每本书的赔偿金额约为3000美元。
2022年之前的书籍成为抢手货
专家表示,人工智能公司如今正面临由自身发展带来的数据困境:开放网络上充斥着大量AI生成文本,如果继续使用这些“被污染”的内容训练新模型,可能导致“模型崩溃”,即机器不断吞噬自身输出、造成性能下降。因此,稀缺、少见且未受AI影响的文本,正成为改进大型语言模型训练质量的重要素材,这对生成式人工智能的发展至关重要。
Anthropic的一位联合创始人曾表示,使用书籍训练人工智能模型,可以让模型学会“如何写出好文章”,而不是去模仿“低质量的网络用语”。Meta公司2024年的一封内部邮件则将获取数字图书资源描述为与AI竞争对手抗衡的“关键要素”。
此外,图书数据库ISBNdb也曾直接向AI公司表示,世界上最优质的AI训练数据就摆在书架上。尤其是2022年之前出版的书籍,被认为是人工智能公司理想的训练材料,因为这些文本尚未受到聊天机器人生成内容的污染。
而对于珍视纸质书价值的二手书商来说,这一过程确实令人不安。爱丁堡二手书店老板德里克·沃克表示,在他出售的书籍中,有一本甚至可能是目前已知唯一幸存的18世纪版本。他说:“如果是一本近年出版、总共只印了100册的学术书,其中75册还在图书馆里,那么销毁一册,也许影响不算太大。但我卖出的一些书,是真正稀有的,有些甚至是目前已知唯一幸存的18世纪版本。”
