IT之家12月18日消息,根据外媒TechCrunch今日报道,作家伊丽莎白·莱昂发起的一项集体诉讼,对Adobe公司提出了新的指控。诉讼称,Adobe在训练其SlimLM语言模型时,使用了大量盗版书籍数据,其中包含莱昂本人的作品。莱昂来自俄勒冈州,长期从事非虚构写作,并出版过多本写作指导类书籍。
Adobe方面介绍,SlimLM是一套面向移动设备文档辅助场景的小型语言模型,其预训练基础为SlimPajama-627B数据集。该数据集由Cerebras公司于2024年发布,被描述为一个去重、多语言的开源集合。然而,诉讼认为,SlimPajama数据集本身的来源就存在问题。
诉讼文件指出,SlimPajama是在复制并加工RedPajama数据集的基础上生成的,而RedPajama包含了备受争议的Books3数据集。Books3收录了约19.1万本图书,其中包含大量受版权保护的作品。
诉讼进一步明确,作为RedPajama的派生数据集,SlimPajama同样包含了Books3中的内容,因此不可避免地纳入了原告及其他作者的版权作品。
围绕Books3和RedPajama的争议,早已不止于Adobe。此前,苹果和Salesforce均因涉嫌在AI训练中使用相关数据集而遭到起诉。相关案件指控企业未经授权使用受版权保护内容。
在更广泛的行业背景下,类似诉讼正在成为常态。AI模型对训练数据规模的高度依赖,使得数据来源问题频频引发法律风险。今年9月,Anthropic同意向多名作者支付1.5亿美元,就其训练Claude模型时使用盗版作品的指控达成和解。该案被外界视为AI训练版权争议的重要节点,然而行业内持续扩大的法律挑战仍未终结。
