游乐游手机版
首页/科技数码/文章详情

摩尔线程加码万卡集群,算力竞争正转向Token工厂

时间:2026-08-04 09:51
摩尔线程在WAIC上展示三大AI工厂进展,基于自研MUSA架构和夸娥万卡集群,算力竞争转向Token成本。训练线性扩展效率达95%,推理通过异构系统降低成本,并推出C256超节点,推动国产GPU进入万卡级大规模训练阶段。

在2026年世界人工智能大会(WAIC)上,摩尔线程一次性发布了三大“AI工厂”的最新成果——模型训练、词元(Token)生产与智能体生产,并首次公开了多项训练与推理的实践数据。这标志着该公司在AI基础设施领域的布局正持续深化。

摩尔线程加码万卡集群,算力竞争转向Token工厂

摩尔线程创始人、董事长兼CEO张建中,将这三类工厂分别定义为“模型训练工厂”“词元生产工厂”和“智能体生产工厂”,全面覆盖模型预训练与强化学习、规模化推理,以及数字智能体与具身智能训练。他强调,这些工厂均基于摩尔线程自研的MUSA架构和“夸娥”万卡智算集群构建而成。

大模型领域的竞争已从预训练阶段延伸至强化学习与智能体应用,算力需求不再仅仅取决于模型参数规模。一个智能体在执行任务时,可能连续调用模型、搜索信息并操作软件工具,Token的消耗场景也从人类主动问答,转向机器自动调用。摩尔线程的研判十分清晰:GPU竞争的核心指标,正从单卡算力转向集群以多低成本和可持续的方式,生产出多少高质量的Token。

在模型训练方面,摩尔线程正在补齐从底层芯片到训练框架的完整软件生态。张建中透露,他们从底层MUSA架构出发,基于MUSA的SDK,兼容了全行业各类算子。目前,MUSA软件栈已适配PyTorch、Triton和TileLang等算子生态,并支持Megatron-LM、DeepSpeed、FSDP,以及强化学习框架VeRL和Slime。

从训练成果来看,摩尔线程宣称,“夸娥”万卡集群的线性扩展效率最高可达95%,有效训练时长占比超过90%。摩尔线程高级副总裁董龙飞向媒体表示,在DeepSeek这类MoE模型上,其平台与国际旗舰GPU训练结果的前3万步平均相对误差,控制在万分之六以内。

在实际训练案例中,摩尔线程已与一家国家级实验室从零开始训练了MoE-236B模型。北京大学EvoPhys团队推出的5D世界模型EvoPhys-World,也在MTT S5000集群上完成了全栈原生训练,并连续37天位居WorldScore世界生成榜单首位。此外,摩尔线程还与北京智源研究院、极佳视界等机构合作,训练具身智能和驾驶世界模型。

摩尔线程密集披露这些训练实例,旨在证明国产GPU已从模型适配阶段,迈入万卡级大规模训练的实际应用。过去,国产GPU更多用于推理场景,原因在于大规模训练对芯片、互联、通信库及软件框架的协同稳定性要求极高,集群中任何单点故障都可能导致持续数周的训练任务中断,从而大幅推高训练成本。

不过,训练仅是算力需求的一部分。董龙飞指出,训练与推理对算力产品的需求存在差异:训练对性能偏差的容忍度相对较高,即便性能低10%,也能通过延长训练时间完成任务;但推理直接关系到单位Token成本,成本高出10%就可能丧失竞争力。

为争夺推理市场,摩尔线程的“词元生产工厂”目标是以更低成本和更高吞吐量,持续生成Token。目前,其推理软件栈已适配SGLang、vLLM等框架,并支持DeepSeek、MiniMax、GLM、Kimi和Qwen等国产大模型,基本实现了主流大模型发布即适配。摩尔线程还表示,与部分模型企业的合作,已从发布后适配前移至研发阶段的联合共研,力争在模型发布当日完成调优。

异构推理是摩尔线程降低Token成本的关键路径。在大模型推理过程中,Prefill(预填充)阶段负责理解输入内容,更依赖计算能力;Decode(解码)阶段逐字生成结果,则更依赖显存容量与带宽。张建中举例称,有客户将Prefill放在S5000上计算,将Decode放在已有的国际主流计算卡上,从而有效降低了成本。

张建中还提到,由3张S5000与2张国际主流GPU组成的异构系统,整体吞吐量可接近9张同类国际GPU的水平。

为进一步扩大单个计算单元规模,摩尔线程推出了C256超节点,将256张GPU通过自研MTLink协议互联并整合为统一系统,既可用于构建10万卡集群,也可承载参数量和上下文窗口持续扩大的模型。

然而,超节点在成本、投资与技术层面均面临重大挑战。董龙飞表示,一套完整超节点的投资在1亿元以上,功耗可能达到400千瓦,除GPU外还需集成CPU,散热、可靠性以及各模组之间的解耦,都是必须攻克的工程难题。他指出,从万卡走向10万卡,并非简单堆叠服务器,而需要“一层层网络级联”的新架构——即由多个超节点组成Pod,再由多个Pod构成10万卡集群。其中,卡间通信与系统可靠性是核心挑战:万卡若有1%的故障率,到10万卡规模,可靠性会呈指数级恶化。

在“智能体生产工厂”布局上,摩尔线程推出了数字智能体“小麦”与具身智能仿真平台MT Lambda,并通过MTT AIBOOK、MTT AICUBE等终端设备探索端云协同。但相较于模型训练与词元生产两大工厂,摩尔线程的“智能体工厂”尚未形成清晰的收入模式。张建中明确表示:“智能体工厂是公司一个全新的研究方向。”

围绕Token经济热潮,产业竞争正从芯片算力供给延伸至集群建设、算力调度与生态运营,各方布局不断。WAIC期间,商汤科技宣布联合近20家国产芯片及基础设施厂商建设Token运营中心,两年内规划5个万卡以上国产算力集群;中科曙光则发布了全国产10万卡AI超集群“曙光8000(登峰)”,采用超智融合架构设计,支持从FP64到INT8全精度计算,实现了全类型计算的原生一体化融合。

来源:https://www.163.com/dy/article/L2CEN70205199NPP.html
上一篇万佑智算亮相WAIC,人人可造Agent 下一篇喜马拉雅亮相2026世界人工智能大会携AI创作与智能硬件升级全场景音频体验
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径
科技数码 · 2026-08-31

2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径

2026中国航空产业大会与南昌航空产业博览会将于10月31日至11月4日在南昌国际博览城首次同期举办。大会聚焦低空经济,设置主旨报告、行业专家报告及低空产业洽谈会等主题活动,旨在探讨航空产业新路径,推动低空物流、城市巡检等新业态集聚,打造中部领先、全国知名的航空产业交流高地。

联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南
科技数码 · 2026-08-28

联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南

联想来酷Air 16酷睿5 315版于8月27日正式开售,搭载6核处理器与12GB内存,配备16英寸16:10屏幕。叠加国家补贴后预估到手价仅3739 15元,主打长续航与静音办公。本文详细解析其硬件配置、接口布局及购买建议,助您快速决策。

牛来AirPods保护套海外走红:萌趣硅胶设计引发关注
科技数码 · 2026-08-28

牛来AirPods保护套海外走红:萌趣硅胶设计引发关注

一款名为“牛来”的AirPods硅胶保护套在日本市场引发关注,售价约1726日元。其独特的搞怪萌趣造型、兼容多代机型的硅胶材质以及专属挂饰设计,使其在社交平台上迅速走红,成为近期备受瞩目的国产原创数码周边产品。

行李箱选购全攻略:材质、轮子与尺寸避坑指南
科技数码 · 2026-08-28

行李箱选购全攻略:材质、轮子与尺寸避坑指南

选购行李箱时,材质、轮子和尺寸是核心决策点。PP材质抗冲击且轻便,适合频繁托运;万向轮决定推行顺滑度;尺寸需匹配航空限重。本文拆解关键参数,结合具体产品案例,助您选出耐用且实用的行李箱。

《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验
科技数码 · 2026-08-28

《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验

2026年8月《湮灭之潮》成都试玩会圆满举行,千名玩家现场体验西方奇幻大作。文章重点解析技嘉RTX 5080风魔显卡在虚幻5引擎下的表现,涵盖Blackwell架构、DLSS 4 5技术及16GB GDDR7显存对高画质流畅运行的支撑作用。