在2026年世界人工智能大会(WAIC)上,摩尔线程一次性发布了三大“AI工厂”的最新成果——模型训练、词元(Token)生产与智能体生产,并首次公开了多项训练与推理的实践数据。这标志着该公司在AI基础设施领域的布局正持续深化。

摩尔线程创始人、董事长兼CEO张建中,将这三类工厂分别定义为“模型训练工厂”“词元生产工厂”和“智能体生产工厂”,全面覆盖模型预训练与强化学习、规模化推理,以及数字智能体与具身智能训练。他强调,这些工厂均基于摩尔线程自研的MUSA架构和“夸娥”万卡智算集群构建而成。
大模型领域的竞争已从预训练阶段延伸至强化学习与智能体应用,算力需求不再仅仅取决于模型参数规模。一个智能体在执行任务时,可能连续调用模型、搜索信息并操作软件工具,Token的消耗场景也从人类主动问答,转向机器自动调用。摩尔线程的研判十分清晰:GPU竞争的核心指标,正从单卡算力转向集群以多低成本和可持续的方式,生产出多少高质量的Token。
在模型训练方面,摩尔线程正在补齐从底层芯片到训练框架的完整软件生态。张建中透露,他们从底层MUSA架构出发,基于MUSA的SDK,兼容了全行业各类算子。目前,MUSA软件栈已适配PyTorch、Triton和TileLang等算子生态,并支持Megatron-LM、DeepSpeed、FSDP,以及强化学习框架VeRL和Slime。
从训练成果来看,摩尔线程宣称,“夸娥”万卡集群的线性扩展效率最高可达95%,有效训练时长占比超过90%。摩尔线程高级副总裁董龙飞向媒体表示,在DeepSeek这类MoE模型上,其平台与国际旗舰GPU训练结果的前3万步平均相对误差,控制在万分之六以内。
在实际训练案例中,摩尔线程已与一家国家级实验室从零开始训练了MoE-236B模型。北京大学EvoPhys团队推出的5D世界模型EvoPhys-World,也在MTT S5000集群上完成了全栈原生训练,并连续37天位居WorldScore世界生成榜单首位。此外,摩尔线程还与北京智源研究院、极佳视界等机构合作,训练具身智能和驾驶世界模型。
摩尔线程密集披露这些训练实例,旨在证明国产GPU已从模型适配阶段,迈入万卡级大规模训练的实际应用。过去,国产GPU更多用于推理场景,原因在于大规模训练对芯片、互联、通信库及软件框架的协同稳定性要求极高,集群中任何单点故障都可能导致持续数周的训练任务中断,从而大幅推高训练成本。
不过,训练仅是算力需求的一部分。董龙飞指出,训练与推理对算力产品的需求存在差异:训练对性能偏差的容忍度相对较高,即便性能低10%,也能通过延长训练时间完成任务;但推理直接关系到单位Token成本,成本高出10%就可能丧失竞争力。
为争夺推理市场,摩尔线程的“词元生产工厂”目标是以更低成本和更高吞吐量,持续生成Token。目前,其推理软件栈已适配SGLang、vLLM等框架,并支持DeepSeek、MiniMax、GLM、Kimi和Qwen等国产大模型,基本实现了主流大模型发布即适配。摩尔线程还表示,与部分模型企业的合作,已从发布后适配前移至研发阶段的联合共研,力争在模型发布当日完成调优。
异构推理是摩尔线程降低Token成本的关键路径。在大模型推理过程中,Prefill(预填充)阶段负责理解输入内容,更依赖计算能力;Decode(解码)阶段逐字生成结果,则更依赖显存容量与带宽。张建中举例称,有客户将Prefill放在S5000上计算,将Decode放在已有的国际主流计算卡上,从而有效降低了成本。
张建中还提到,由3张S5000与2张国际主流GPU组成的异构系统,整体吞吐量可接近9张同类国际GPU的水平。
为进一步扩大单个计算单元规模,摩尔线程推出了C256超节点,将256张GPU通过自研MTLink协议互联并整合为统一系统,既可用于构建10万卡集群,也可承载参数量和上下文窗口持续扩大的模型。
然而,超节点在成本、投资与技术层面均面临重大挑战。董龙飞表示,一套完整超节点的投资在1亿元以上,功耗可能达到400千瓦,除GPU外还需集成CPU,散热、可靠性以及各模组之间的解耦,都是必须攻克的工程难题。他指出,从万卡走向10万卡,并非简单堆叠服务器,而需要“一层层网络级联”的新架构——即由多个超节点组成Pod,再由多个Pod构成10万卡集群。其中,卡间通信与系统可靠性是核心挑战:万卡若有1%的故障率,到10万卡规模,可靠性会呈指数级恶化。
在“智能体生产工厂”布局上,摩尔线程推出了数字智能体“小麦”与具身智能仿真平台MT Lambda,并通过MTT AIBOOK、MTT AICUBE等终端设备探索端云协同。但相较于模型训练与词元生产两大工厂,摩尔线程的“智能体工厂”尚未形成清晰的收入模式。张建中明确表示:“智能体工厂是公司一个全新的研究方向。”
围绕Token经济热潮,产业竞争正从芯片算力供给延伸至集群建设、算力调度与生态运营,各方布局不断。WAIC期间,商汤科技宣布联合近20家国产芯片及基础设施厂商建设Token运营中心,两年内规划5个万卡以上国产算力集群;中科曙光则发布了全国产10万卡AI超集群“曙光8000(登峰)”,采用超智融合架构设计,支持从FP64到INT8全精度计算,实现了全类型计算的原生一体化融合。
