最近,AI圈再次掀起轩然大波。据Wired报道,多家科技巨头在未获得YouTube视频创作者授权的情况下,直接抓取平台上的字幕文件用于训练AI大模型。苹果、英伟达等知名公司赫然出现在涉事名单中,引发了关于AI训练数据版权的广泛讨论。

此次“中招”的创作者阵容颇具分量,包括科技圈顶流MKBHD、粉丝量惊人的MrBeast、元老级主播PewDiePie,以及多位脱口秀大咖,如斯蒂芬·科尔伯特、约翰·奥利弗和吉米·坎摩尔。这些被用作AI训练素材的字幕文件,本质上是视频的完整文本转录,其内容未经许可便被用于模型喂养。
调查记者披露的信息显示,全球市值最高的几家科技公司长期“偷师”YouTube上的海量视频素材来训练AI,这直接违反了YouTube关于禁止未经许可抓取平台内容的规定。据统计,来自4.8万个频道的超过17.3万个YouTube视频的字幕文件,均被用于喂养AI模型。其中涉及的硅谷巨头,包括苹果、英伟达和Salesforce。
那么,这些“违禁”数据究竟从何而来?一个名为EleutherAI的非营利组织成为了关键角色。该组织最初声称,下载这些字幕文件是为了帮助开发者训练AI模型。尽管初衷可能是为小型开发者和学术研究者提供便利,但最终这个数据集被苹果等科技巨头盯上,并用于商业AI训练。
根据EleutherAI自己发布的研究论文,该数据集是其巨型项目“The Pile”的一部分。The Pile中的大部分数据均为公开资源,只要能承受存储和计算压力,任何人都可以下载。除了科技巨头,不少学者和独立开发者也在使用。但问题在于,苹果、英伟达和Salesforce这类市值动辄数百亿甚至上千亿美金的公司,不仅使用了这些数据,还在自家的研究论文和博客中公开提及如何利用该数据集训练AI模型。
一个值得关注的细节是,有文件明确显示,苹果在今年4月发布重磅的OpenELM模型之前几周,就已经在用The Pile进行训练。而OpenELM的发布,恰好赶上苹果高调宣布要在iPhone和MacBook中加入全新AI功能的关键时刻,这使得AI训练数据来源的合规性备受质疑。
这里必须澄清一点:苹果自身并未直接动手去YouTube下载数据,这一行为是由EleutherAI完成的。因此,从技术违规的角度来看,实际上是EleutherAI违反了YouTube的使用条款,而非苹果直接侵权。
不过,尽管苹果等公司使用的是公开数据集,但这起事件却将一个问题彻底摆上台面——从网络上随意抓取数据来训练AI系统,背后隐藏的法律风险究竟有多大?此前就出现过AI在回答小众问题时直接抄袭整段文本的案例,而当这些大公司依赖第三方编译的数据集时,无异于将未经许可使用素材的风险层层叠加,最终埋下巨大的隐患。这也再次引发了业界对AI训练数据版权和YouTube数据抓取行为的深刻反思。
