游乐游手机版
首页/AI热点日报/热点详情

大模型智能革命打破算力瓶颈的关键方法

类型:热点整理2026-07-22
大模型参数量与所需算力呈平方关系,规模翻倍则算力需求增四倍。DeepMind研究表明,充分训练比单纯扩大参数更有效,中小模型挖潜可显著提升性能。发展AI需优先突破算力瓶颈。
大模型时代已全面展开,国内正式发布的大模型数量早已突破200个,且这一数字仍在持续攀升。就在过去的一周多时间里,中国农业大学推出了“神农大模型”,网易也发布了“子曰”大模型2.0版本。模型迭代的速度,几乎是一天一个台阶。 模型的智能涌现水平与参数量直接挂钩。“大”依然是主流升级方向。以GPT系列为例,GPT-2的参数量为15亿,GPT-3直接跃升至1750亿,提升了100倍;到了GPT-4,有消息称参数量已达到1.8万亿,又翻了10倍。参数规模越大,训练所需的计算量就越大,消耗的算力也越多。任何一个大模型的开发或升级,都必须考虑算力约束。那么,模型的规模与所需算力之间,究竟存在怎样的关系?搞清楚这一点,才能在模型升级时做好算力预算。 **模型所需算力,正比于参数量的平方** 当前最主流的AI架构是Transformer。我们以Transformer为核心的大模型为例来估算计算量。大模型的参数量主要取决于隐藏层的维度(h)和构成模型的Block数量(i)。假设隐藏层维度为h,Block数量为i,那么大模型的参数量可以表示为某个表达式。再考虑训练时输入的batch size和每个输入序列的长度(s),整个模型训练一次的计算量则有严格推导的公式。用C代表所需算力当量,N代表模型参数量,两者关系如下: 由于在百亿、千亿参数的大模型中,隐藏层维度h远大于输入序列长度s,因此s的影响可以忽略。上述公式可近似为6b×s,而b×s正是单次训练输入的总token数,记为D。由此得出估算公式: D和N的相关性很强——模型越大,训练所需的总token数也越大。可以把这种关系近似为线性函数N = kD,其中k是常数。代入公式后得到: 换句话说,模型规模增大一倍,所需算力就要增大四倍;如果增大10倍,算力需求就膨胀100倍。算力需求的增长速度已经超越了当前计算技术的极限,大模型竞赛,本质上已经转变为算力竞赛。 在实际的前沿探索中,算力成了最大的瓶颈。仅从资金角度看,训练千亿、万亿参数的大模型,成本已经超出了大多数企业的承受能力。即便财大气粗如OpenAI,也负担得相当吃力——据透露,GPT-4每次训练的成本高达6300万美元。 **算力分配的变化——氪算力可直接提高智能涌现** 增大参数量但降低训练量,或者保持参数量不变、直接加大训练量,两种方法都能提升模型的智能涌现水平。好钢要用在刀刃上,在有限的算力约束下,究竟如何分配?早先的研究一直倾向于前者。2020年OpenAI提出:给定10倍的计算预算,建议模型大小增加5.5倍,而训练token数量只增加1.8倍。 但2023年DeepMind拿出了新观点——模型大小和训练token数量应该等比例缩放:模型增大一倍,token数量也应增加一倍。DeepMind还指出,当前的大模型普遍存在训练不足的问题:一个模型若要训练充分,每个参数应被训练约20个token,而业界主流大模型普遍达不到这个水平,多数不高于每个参数10个token。 这一结论来自严格的技术实验。DeepMind用1.4万亿token训练了一个700亿参数的大模型Chinchilla,它的表现竟然超过了参数量2800亿的Gopher、1750亿的GPT-3以及5300亿的Megatron-Turing。结果一出,行业风向悄然改变。 综合来看,可以进一步将公式量化为:一个大模型要训练得比较彻底,所需算力当量大约是模型规模平方的120倍。在DeepMind的研究发布后,模型“大”竞赛开始放缓。2022年人类还在冲击千亿级别,2023年除了GPT-4之外,新发布的模型并没有突破万亿级别,反而出现了很多百亿级别的模型。控制规模、做更充分的训练,反而能获得更理想的智能涌现。 举个例子,浪潮信息的“源”大模型,1.0版本参数量2450亿,零样本和小样本学习表现优异,能和人对话、玩剧本杀、写公文——相当于一个文科生。但2.0版本最大参数量只有1026亿,却能进行高水平的逻辑推理、做数学题、写代码,相当于一个985大学的理科生,水平完全不是一个量级。 这意味着,投入更大算力对百亿、千亿级别的模型进行“挖潜”,具有非常重大的现实意义。中小模型,以及由这些基础模型生成的技能模型,对硬件和能源的消耗相对较小。假如基础大模型的参数规模降低1%,那么对应技能模型的每次推理计算消耗也会降低1%,这带来的社会意义和经济意义不可估量。 **发展AI,应该优先发展计算力** 客观地说,今天的AI还处在初级阶段,才刚刚开始真正走进社会经济和日常生活。未来可能不仅是每个场景会有一个大模型,甚至每个人都会拥有自己的大模型——这并不是天方夜谭,而是很快就能看到的现实。因此,在相当长的一段时间内,大模型的训练需求将保持旺盛增长,算力瓶颈将是长期问题。发展AI,就得优先发展算力。无论国家还是企业,都应该把更多资源投入到算力产业中。
来源:https://m.elecfans.com/article/2369416.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。