近期科技领域最受关注的事件,莫过于斯坦福大学AI团队推出的Llama3-V模型被揭露存在严重抄袭行为——该模型套壳复制了国内清华与面壁智能联合研发的开源模型“小钢炮”MiniCPM-Llama3-V 2.5。这一风波不仅冲击了开源社区的信任基础,也重新引发了关于开源大模型合规使用问题的广泛讨论。

斯坦福Llama3V模型被证实抄袭
5月29日,斯坦福大学一个AI研究团队在GitHub等平台高调发布了Llama3-V,声称仅需500美元即可训练出具备SOTA水平的多模态模型,性能逼近GPT-4V、Gemini Ultra等顶级产品。凭借名校光环和夸张的效果描述,该模型迅速在社交媒体上引发热议,推特相关话题浏览量突破30万,并直接登上HuggingFace首页。
然而热度尚未消退,便有细心的用户发现端倪——Llama3-V与面壁智能的MiniCPM-Llama3-V 2.5存在高度相似性。团队最初辩解称仅使用了后者的tokenizer,但用户并不认同这一说法,有人在GitHub页面直接指出套壳问题,而这些质疑很快被删除。不满的用户转而到MiniCPM页面下重新陈述问题,并提醒面壁团队重视。面壁团队经过测试发现,在具有“胎记”级别的案例上,两者表现100%一致,事实确凿。
事件迅速在海外媒体中发酵。不久后,斯坦福团队承认抄袭,本科生Siddharth Sharma和Aksh Garg发布了道歉声明。但据称是主要责任人的Mustafa Aljadery——南加利福尼亚大学的学生,始终未露面,甚至处于“失联”状态。Aksh在道歉中解释:三人共同发布了Llama3-V,由Mustafa负责编写代码,但从事发前一天起便无法联系上对方。两人承认自己主要负责推广工作,未能仔细验证模型原创性,“对没有努力核实这项工作感到失望”。他们随后撤回了模型,并再次致歉。
6月3日,面壁智能CEO李大海和联合创始人刘知远先后发文回应。李大海表示:“对这件事深表遗憾。一方面感慨这也是一种受到国际团队认可的方式,另一方面呼吁大家共建开放、合作、有信任的社区环境。”他希望团队的好工作能被更多人关注,但并不是以这种方式。
补充一点背景信息:MiniCPM-Llama3-V 2.5是MiniCPM-V系列的最新版本,基于SigLip-400M和Llama3-8B-Instruct构建,参数规模为8B。在综合11个主流多模态基准的OpenCompass榜单上,其平均得分达到65.1,超越了GPT-4o、GPT-4V、Gemini Pro、Qwen-VL-Max等商用闭源模型——一个开源模型能达到如此水平,确实实力强劲。
开源大模型规范使用值得关注
开源大模型一直是AI发展的重要方向,代表产品包括LLaMA、Grok-1、Stable Code Instruct-3B、Mistral 8x7B,以及零一万物的Yi-34B。它们开箱即用,显著提升了数据安全性与隐私保护水平,同时为开发者节省了大量成本。但硬币的另一面是:开源本身意味着代码和权重完全公开,抄袭的门槛极低。
事实上,这并非首次发生。去年11月,零一万物的Yi-34B就被国外开发者质疑完全套用了Meta的LLaMA架构,仅修改了两个张量名称。零一万物当时回应称,他们沿用了GPT/LLaMA的基础架构,认为社区贡献本就可以复用,而真正的投入集中在数据工程、训练方法、监测技巧、超参数设置、评估方法等更深层领域。这一解释虽然部分合理,但仍引发了关于“什么才算正当使用开源”的持续争议。
再往前追溯,2022年智源研究院的大模型研究中心也曾爆出丑闻:一篇有100位作者署名的综述《A Roadmap for Big Model》被指抄袭多篇论文内容,引发国内外学者广泛关注。商汤、谷歌等公司也先后被曝出过类似问题。
说到底,目前AI大模型在防止抄袭、版权归属等方面,规则仍相当模糊。模型训练过程中使用了他人作品是否构成侵权?大模型生成的产物是否拥有版权?这些问题已有相关案件发生,但尚未形成统一标准。可以确定的是,随着行业走向成熟,杜绝抄袭、厘清版权归属,最终将逐步有法可依——到那时,整个生态才能真正实现健康发展。
结语
斯坦福团队此次抄袭事件,撕开了开源大模型监管漏洞的一角,也暴露出更深层的数据与版权归属问题。归根结底,AI大模型目前仍处于“野蛮生长”阶段,要真正走向规范,行业法规的健全是不可回避的关键一步。
