游乐游手机版
首页/AI热点日报/热点详情

AI大模型数据争夺战全面升级

类型:热点整理2026-07-19
高质量语言数据存量预计2026年耗尽,数据枯竭将制约大模型规模化增长。数据标注需求激增,但传统模式难以满足RLHF等新需求,行业面临人才与技术升级挑战,数据争夺战已全面展开。

大模型产业落地正酣,一个关键瓶颈正在浮出水面——数据不够用了。这不是危言耸听,而是来自Epoch AI Research团队的一项严肃研究给出的预判。

研究人员做了一件事:系统盘点了2022年至2100年间人类可用的图像和语言数据总量,并据此推演了未来大模型训练数据集规模的增长曲线。结论相当残酷——高质量的语言数据存量将在2026年耗尽;低质量的语言数据和图像数据,也分别会在2030年至2050年、2030年至2060年之间枯竭。换句话说,如果数据效率没有质的飞跃,或者没有新的数据源可用,那么到2040年,模型的规模化增长就会被迫减速。

AI大模型终于走到了数据争夺战

数据端建设的紧迫性,已经不言而喻。

高质量数据成“抢手货”

从GPT系列实验可以清晰看到:模型参数量越大,性能提升越明显。但有一个细节值得玩味——通过RLHF(人类反馈强化学习)训练出来的InstructGPT,虽然只有GPT-3百分之一的参数量,效果却更好。这恰恰说明,有监督的标注数据才是大模型应用落地的关键之一。

如果前述预测成立,那么数据将成为制约模型继续做大的主要瓶颈,AI的整体进展也会随着数据存量的耗尽而放缓。阿里巴巴达摩院基础视觉团队负责人赵德丽博士在采访中直言:数据侧的建设,将成为每个做大模型的机构必须面对的问题;大模型的能力边界,往往就取决于它“吃”进了什么样的数据。

赵博士举了一个很生动的例子:文生视频大模型比文生图大模型难做得多,根本原因就是视频数据的量级远不及文本和图像,更别提数据质量了。结果就是,目前已经面世的文生视频模型,效果都不太理想。

结合Epoch AI的研究,如果趋势不改,人类现有的数据库存一定会见底,而高质量数据会更加稀缺。于是,一场数据争夺战已经悄然打响。

Adobe率先动了起来:靠着自己数亿张的库存照片数据库,构建了Firefly人工智能工具套件。自今年3月发布以来,Firefly已生成超过10亿张图像,Adobe股价也因此上涨了36%。另一边,初创公司也蜂拥而至。4月,数据库公司Wea viate融资5000万美元,估值2亿美元;一周后,竞争对手PineCone以7.5亿美元估值拿到1亿美元;紧接着,数据库初创Neon又获得了4600万美元融资。在国内,百度智能云近期升级了大模型数据服务能力,建设了国内首个专业大模型数据标注基地,目前已在全国与各地政府合作共建了10多个数据标注基地。

很明显,对数据的争夺才刚刚开始。

数据标注再次迎来爆发

AI大模型带来的海量需求,正在直接拉动中国数据标注行业的迅速增长。招商证券分析指出:一方面,人们各种行为的电子化、网络化产生了海量数据,但真正能被收集和保存的只有1%,而且其中90%是非结构化数据;另一方面,人工智能的兴起带来了对结构化数据的巨大需求,数据标注的重要性因此愈发突出。

有业内人士预测,今年10月国内会迎来一波类似ChatGPT的大模型数据需求高峰,而且规模非常大——以目前几家头部数据标注公司的产能来看,根本满足不了。艾瑞咨询的数据也印证了这一点:包括数据采集、标注、存储、挖掘在内的AI基础数据服务市场,未来几年将持续增长。到2025年,国内AI基础数据服务市场整体规模预计达到101.1亿元,增速约31.8%。iResearch的数据则显示,2019年我国数据标注市场规模为30.9亿元,预计2025年突破100亿元,年复合增长率达14.6%。

数据标注涉及的领域也在不断拓宽,尤其是自动驾驶和AIGC领域,标注需求量极大。作为AI大模型高质量回答的基础,数据标注的生产过程包含四个环节:设计(训练数据集结构设计)、采集(获取原料数据)、加工(数据标注)、质检(各环节质量检测)。其中,数据标注需要识别图像、文本、视频等原始数据,并添加标签为机器学习模型指定上下文,帮助其做出准确预测。

目前,大部分数据标注任务仍然依赖人工完成,不同数据类型和应用领域也需要相应的专业标注员。技术发展让这个行业正变成半人工智能、半人工化的模式。面对大语言模型动辄上百亿参数的数据质量控制,需要通过标注平台将复杂的RLHF需求拆解成多个简单工作流:机器做预处理,人做深层的基于理解的反馈。这样能减少简单问题上的精力消耗,让标注人员专注于专业问题。

业内通常采用主动质检加被动质检的方式:前者靠人为质检,后者靠算法做预识别。目前数据标注工具的准确率参差不齐,低的只有百分之几,高的可以达到80%甚至90%。机器标注识别率越高,人工需求就越少,成本、利润、速度和质量也就更加可控。未来,数据标注行业可能会实现更高程度的自动化,但不同应用领域仍然需要一定数量的专业标注人员。

传统数据标注亟待升级

值得注意的是,在如今火爆的大模型训练浪潮中,传统数据标注的需求很可能是下降的。让ChatGPT更具“人味儿”的关键——RLHF,带来的是另一种更高要求的数据标注需求。

相关分析显示,在RLHF环节,模型先在大型数据集上预训练,再与专业的人工智能训练师交互。标注人员会对ChatGPT生成的回答进行标注、评估和反馈,给出分数或标签。这些标注数据作为强化学习过程中的“奖励函数”,指导ChatGPT的参数调整,帮助模型不断优化。让ChatGPT“更具人味儿”的精妙之处就在于:它能利用人工标注的反馈结果不断优化自身,实现更符合人类思维逻辑的表达。

但传统数据标注模式很难满足RLHF的需求。过去,数据标注公司的主流商业模式是销售工具系统和标注服务,一方面缺少自有数据,很少能提供精准数据集;另一方面,人才升级是系统工程,对数据标注公司的考验更大。完成标注后,RLHF训练还涉及不少事实判断和价值判断。价值判断涉及公认的“公序良俗”,相对容易拉齐AI认知;事实判断则涉及各行业Know-How,往往需要行业专业人士出手,而不是传统数据标注员简单针对词性、图片细节就能实现的。

也就是说,要跟上新一代AI浪潮,数据标注公司不仅要在数据层面升级,人才的更新换代同样重要。目前已有标注公司开始在内部撰写《人员提升教程》,重点培训标注人员对“升级后”标注需求的理解,以及回答方式的合规性等。但在专业壁垒极高的医疗等领域,数据标注仍面临人才困境。某数据标注公司运营负责人曾表示:“特别是医疗,有些是普通人经过培训可以标的,有的必须要医疗从业者,背后的人才招聘难度可想而知。”

即便困难重重,也不意味着数据标注公司会立刻洗牌——至少在大模型训练的几个阶段内,初始阶段的半监督学习仍然对传统数据标注有需求。面对大模型和RLHF的机遇,大规模投入似乎在所难免。有业内人士认为,如果数据标注公司期望在垂直领域做更高层级的数据服务,可能需要成立全新的产品线。甚至,具备AI研发背景的创始人会是更合适的数据标注创业者。

面对新一代AI浪潮,没有人可以躺着挣钱——这是每一次技术迭代背后,早已标好的“价格”。

来源:https://m.elecfans.com/article/2234486.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。