游乐游手机版
首页/AI热点日报/热点详情

智谱唐杰谈万亿参数:大模型行业早期探索阶段

类型:热点整理2026-08-21
智东西编译 茄子编辑 李水青智东西8月19日报道,今天下午,智谱联合创始人、首席科学家唐杰在X平台发文,系统分享了他对Scaling Law(扩展定律)的最新理解,并解释了智谱为何没有继续扩大GLM-5 3的参数规模,而是将这一轮大模型训练重点放在长程任务环境和强化学习优化上。▲唐杰发文(图源:X)


智东西
编译 茄子
编辑 李水青

智东西8月19日报道,今天下午,智谱联合创始人、首席科学家唐杰在X平台发文,系统分享了他对Scaling Law(扩展定律)的最新理解,并解释了智谱为何没有继续扩大GLM-5.3的参数规模,而是将这一轮大模型训练重点放在长程任务环境和强化学习优化上。


▲唐杰发文(图源:X)

唐杰认为,讨论大模型规模不能只盯着参数量,还必须同时考虑训练数据规模、计算资源的投入方式,以及模型最终由谁在什么场景和条件下运行。参数量、预训练数据、单次前向计算深度和后训练都属于可扩展维度,并不存在一个永远最值得优先放大的单一指标。

他回顾称,2020年的相关研究曾一度推动整个AI行业优先扩大参数量,GPT-3、Gopher和MT-NLG等模型都在这一思路影响下发展。然而,2024年发布的Chinchilla研究提出,训练数据与参数规模需要更加均衡的配置。基于这一变化,唐杰认为,行业此前集中追逐万亿参数模型,事后来看更像是一段集体走过、又集体回头的弯路。

不过,Chinchilla也并不是Scaling Law的最终答案。如今,大模型每天会被调用数十亿次,推理成本在模型全生命周期中的占比持续上升。因此,最优策略开始转向“模型更小、训练更久”的路线。此外,混合专家模型(MoE)的持续普及,也让总参数量与每次实际激活的参数量必须分开分析。

唐杰表示,总参数量更多决定模型能够容纳多少知识,而激活参数量和有效计算深度,则更影响模型能完成多长的推理链。以漏洞发现、安全分析等任务为例,仅仅记住更多漏洞信息远远不够,模型还需要稳定完成连续多步推理。

在GLM-5.3上,智谱并没有改变GLM-5.2的基础模型、架构、总参数量和激活参数量,而是用一个月时间重点扩展长程任务环境和强化学习训练。唐杰称,这样带来的性能提升并非边际改良,而是较为明显的增强。

他将模型扩展比作调节多个旋钮。这一次,智谱选择了提升空间仍然较大的后训练方向,但这并不意味着参数规模、预训练数据和单次前向计算已经不重要。智谱后续仍可能继续扩大中期训练、预训练以及其他关键训练环节。

唐杰的发文也引发了外界对Scaling Law下一阶段发展方向的热议。有网友追问,后训练领域何时会出现类似Chinchilla的Scaling Law研究,以及GLM的强化学习曲线目前究竟已经趋于平缓,还是依然存在继续增长的空间。


▲网友对唐杰发文评论(图源:X)

另一位网友则以千问Qwen 3.8 27B和GLM-5.3为例,认为中小规模模型依然具备明显的提升空间,视觉理解能力与运行速度,可能会成为GLM系列接下来的重要升级方向。


▲网友对唐杰发文评论(图源:X)

还有一位网友把关注点放在“如何提问”上。他认为,真正值得重视的不只是问题表面的答案,更是其背后更深层的结构,“能够提出好问题的人,比能够给出答案的人更加少见”。


▲网友对唐杰发文评论(图源:X)

以下是唐杰发文全文编译,智东西在不改变原意的基础上进行了编辑整理。

关于Scaling Law的一些思考

模型规模仍在持续扩大,但真正需要扩展的,不应只有参数量。

如今每次发布大模型,最后几乎都会被问到同一个问题:它到底有多少参数?

这个问题如果脱离其他前提,其实很难单独回答。参数量只有和另外三个问题一起看才有意义:拥有多少训练数据、准备把计算资源投入到哪里,以及谁会在什么条件下运行这个模型。

这个领域也是通过大量实践、甚至走过一些弯路之后,才逐渐理解这一点。

Kaplan等人在2020年的研究中拟合出一项扩展规律,认为参数规模的增长速度应该快于数据规模,两者对应的扩展指数大约为0.73和0.27。此后,整个大模型行业都在一定程度上遵循了这一方向,包括GPT-3、Gopher和MT-NLG。

Hoffmann等人在2024年重新对约400个模型展开实验,发现计算量最优的配置更接近每个参数对应20个Token。在计算资源充足的情况下,参数量和数据量应以接近相同的速度增长,而不是不断拉大差距。

早期拟合中的误差,会随着计算量每提升一个数量级而进一步放大。因此,那一代规模最大的模型,反而也成了计算资源分配最不合理的一批模型。

现在回头看,追逐万亿参数大模型,是整个行业曾共同走过、又一起折返的一段弯路。

但Chinchilla也不是终点答案。

Chinchilla优化的是模型训练阶段的计算量,其默认前提是模型训练一次,随后再进行评估。而现在,一个大模型每天可能被调用数十亿次,推理成本已经开始在模型全生命周期成本中占据主导位置。

如果把推理成本也一并纳入优化目标,最优方案就会向规模更小、训练更长的模型迁移。这本质上是一种有意识的“过度训练”。Llama-2-7B和Gemma-2-9B采用的就是类似路线,这两款模型平均每个参数分别对应约290个和889个训练Token。

稀疏模型的兴起,又一次改变了优化目标。

在混合专家模型中,需要区分两个关键指标:总参数量大致决定模型能够容纳多少知识,包括事实知识和长尾知识;而实际激活的参数量与有效计算深度,则大致决定模型能够完成多深入的思考,以及可以维持多少步因果推理而不崩溃。

因此,稠密模型中每个参数对应20个Token的经验比例,并不能直接照搬到MoE模型上。

而且,这个比例本身也不是固定不变的。Roberts等人在2025年的研究发现,最优Token参数比与任务类型密切相关:记忆类任务更受益于增加参数量,推理类任务则更受益于增加训练数据。

后续针对MoE的研究还发现,在Token参数比不变的情况下,继续增加总参数量,反而可能削弱推理能力;而增加每次激活的专家数量,则能更稳定地提升推理表现。

这和我们正在打造的模型能力直接相关。

寻找一项安全漏洞,并不是简单的信息检索任务。它不取决于模型记住了多少CVE漏洞记录,而取决于模型能否完成一条包含20个步骤的推理链,并且在到达终点前始终保持思路连贯和逻辑稳定。

这种能力本身,并不天然存在于总参数量之中。

接下来谈谈GLM-5.3。

总参数量在达到某个阈值之前依然非常重要,模型首先必须具备足够容量,才能容纳对世界的基本认识。但当超过这一阈值后,更多能力往往需要从其他方向获得,包括提升每次前向计算的有效深度,尤其是加强后训练。

GLM-5.3就是我们围绕这一判断所做的一次对照实验。

GLM-5.3采用了与GLM-5.2相同的基础模型、架构、总参数量和激活参数量。我们用一个月时间重点扩大长程任务环境和强化学习训练,最终获得的性能提升,并不是轻微改进,而是较为显著的提升。

Scaling并不只有一个旋钮。

这一次,我们选择调高后训练这个旋钮,是因为它目前仍然具备最大的提升空间,而不是因为其他方向已经走到终点。

基础模型规模、预训练数据以及每次前向计算投入的算力,仍然都是可以继续扩展的重要方向,我们之后也会重新回到这些方面。

这次实验让我们进一步认识到,这些旋钮并不需要同时转动;而下一步最值得优先调整的指标,通常也未必是上一次最值得调整的指标。

我们并没有停止扩展。下一次,可能会轮到中期训练、预训练,甚至是更大规模的投入。

来源:X


来源:https://www.163.com/dy/article/L4Q3TJBC051180F7.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。