首先,几个核心亮点值得关注。Skywork-MoE完全开源,并支持免费商用,模型权重与技术报告均已开放下载,无需申请、无需授权。更为关键的是,其推理成本大幅降低——在保持强劲性能的同时,能够运行在单台4090服务器上。这是目前首个支持单台4090推理的开源千亿级MoE大模型。
### 模型关键参数与性能
Skywork-MoE总参数量达到146B,但激活参数量仅为22B。它由16个专家(Expert)组成,每个专家大小为13B。在同等激活参数量下,其能力处于行业前列,甚至接近70B的Dense模型,而推理成本却降低了近3倍。在8×4090服务器上,借助昆仑万维首创的非均匀Tensor Parallel并行推理,吞吐量可达2200 tokens/s。
### 训练优化的两把“钥匙”
MoE模型训练存在两大难题:训练不稳定与泛化性能差。Skywork-MoE为此专门设计了两项训练优化算法——Gating Logits归一化操作与自适应的Aux Loss。前者使门控输出更加稳定,后者则在不破坏主任务的前提下,动态平衡专家负载。简单来说,就是让模型既学得快,又不偏离方向。
### 大规模分布式训练:从数据并行到流水并行
在工程层面,团队提出了**Expert Data Parallel**方案——当专家数量不多时,也能高效切分模型,避免通信瓶颈。同时,他们还设计了一套**非均匀切分流水并行**:传统流水并行中每个阶段计算量相等,而这里根据实际计算/显存负载进行了非均匀分配,使整个训练过程更加平衡、高效。
### 实验经验:什么时候该“从零训练”?
关于MoE的训练策略,研究团队通过Scaling Law实验给出了一个实用规则:如果训练MoE模型的FLOPs超过训练Dense模型的2倍,则应选择From Scratch(从头训练)MoE,否则采用Upcycling(从Dense模型升级)更为划算。这为后来者节省了大量试错成本。
Skywork-MoE的开源,确实为社区提供了一个既强大又经济的工具。尤其在数据规模大、计算资源有限的应用场景中,这或许是一个值得认真研究的选项。昆仑万维开源两千亿稀疏大模型Skywork-MoE性能强劲成本更低
昆仑万维开源稀疏大模型Skywork-MoE,总参数量146B,激活22B,16个专家。支持单台4090推理,性能接近70BDense模型,推理成本降低近3倍。采用GatingLogits归一化与自适应AuxLoss训练优化,以及ExpertDataParallel和非均匀流水并行方案,并给出从头训练与升级策略的选择规则。
随着大模型技术的持续迭代,昆仑万维此次发布了一项真正重磅的成果——开源了稀疏大模型Skywork-MoE。这一模型的意义不仅在于“又一个新的大模型”,更在于其以更低的推理成本,向传统密集型大模型长期以来居高不下的算力门槛发起了挑战。
首先,几个核心亮点值得关注。Skywork-MoE完全开源,并支持免费商用,模型权重与技术报告均已开放下载,无需申请、无需授权。更为关键的是,其推理成本大幅降低——在保持强劲性能的同时,能够运行在单台4090服务器上。这是目前首个支持单台4090推理的开源千亿级MoE大模型。
### 模型关键参数与性能
Skywork-MoE总参数量达到146B,但激活参数量仅为22B。它由16个专家(Expert)组成,每个专家大小为13B。在同等激活参数量下,其能力处于行业前列,甚至接近70B的Dense模型,而推理成本却降低了近3倍。在8×4090服务器上,借助昆仑万维首创的非均匀Tensor Parallel并行推理,吞吐量可达2200 tokens/s。
### 训练优化的两把“钥匙”
MoE模型训练存在两大难题:训练不稳定与泛化性能差。Skywork-MoE为此专门设计了两项训练优化算法——Gating Logits归一化操作与自适应的Aux Loss。前者使门控输出更加稳定,后者则在不破坏主任务的前提下,动态平衡专家负载。简单来说,就是让模型既学得快,又不偏离方向。
### 大规模分布式训练:从数据并行到流水并行
在工程层面,团队提出了**Expert Data Parallel**方案——当专家数量不多时,也能高效切分模型,避免通信瓶颈。同时,他们还设计了一套**非均匀切分流水并行**:传统流水并行中每个阶段计算量相等,而这里根据实际计算/显存负载进行了非均匀分配,使整个训练过程更加平衡、高效。
### 实验经验:什么时候该“从零训练”?
关于MoE的训练策略,研究团队通过Scaling Law实验给出了一个实用规则:如果训练MoE模型的FLOPs超过训练Dense模型的2倍,则应选择From Scratch(从头训练)MoE,否则采用Upcycling(从Dense模型升级)更为划算。这为后来者节省了大量试错成本。
Skywork-MoE的开源,确实为社区提供了一个既强大又经济的工具。尤其在数据规模大、计算资源有限的应用场景中,这或许是一个值得认真研究的选项。
首先,几个核心亮点值得关注。Skywork-MoE完全开源,并支持免费商用,模型权重与技术报告均已开放下载,无需申请、无需授权。更为关键的是,其推理成本大幅降低——在保持强劲性能的同时,能够运行在单台4090服务器上。这是目前首个支持单台4090推理的开源千亿级MoE大模型。
### 模型关键参数与性能
Skywork-MoE总参数量达到146B,但激活参数量仅为22B。它由16个专家(Expert)组成,每个专家大小为13B。在同等激活参数量下,其能力处于行业前列,甚至接近70B的Dense模型,而推理成本却降低了近3倍。在8×4090服务器上,借助昆仑万维首创的非均匀Tensor Parallel并行推理,吞吐量可达2200 tokens/s。
### 训练优化的两把“钥匙”
MoE模型训练存在两大难题:训练不稳定与泛化性能差。Skywork-MoE为此专门设计了两项训练优化算法——Gating Logits归一化操作与自适应的Aux Loss。前者使门控输出更加稳定,后者则在不破坏主任务的前提下,动态平衡专家负载。简单来说,就是让模型既学得快,又不偏离方向。
### 大规模分布式训练:从数据并行到流水并行
在工程层面,团队提出了**Expert Data Parallel**方案——当专家数量不多时,也能高效切分模型,避免通信瓶颈。同时,他们还设计了一套**非均匀切分流水并行**:传统流水并行中每个阶段计算量相等,而这里根据实际计算/显存负载进行了非均匀分配,使整个训练过程更加平衡、高效。
### 实验经验:什么时候该“从零训练”?
关于MoE的训练策略,研究团队通过Scaling Law实验给出了一个实用规则:如果训练MoE模型的FLOPs超过训练Dense模型的2倍,则应选择From Scratch(从头训练)MoE,否则采用Upcycling(从Dense模型升级)更为划算。这为后来者节省了大量试错成本。
Skywork-MoE的开源,确实为社区提供了一个既强大又经济的工具。尤其在数据规模大、计算资源有限的应用场景中,这或许是一个值得认真研究的选项。来源:https://www.1ai.net/12273.html
相关热点
继续查看同栏目近期热点。
延伸阅读
补充最近整理过的热点入口。
