在2026年世界人工智能大会(WAIC)上,摩尔线程发布了一系列重磅消息,聚焦国产算力产业链的核心突破。首先,几项关键信息值得关注:一款拥有236B参数的MoE大模型,基于国产万卡级算力集群完成训练;一款面向具身智能的大脑模型,则依托国产千卡集群实现支撑;此外,北京大学EvoPhys团队的首个全球5D世界模型——EvoPhys-World,其全栈原生训练过程完全依赖MUSA软件栈提供底层技术支持。
具体而言,MoE-236B模型基于超过25T的语料数据,在摩尔线程的万卡级集群上从零开始预训练,并顺利推进至长窗口训练阶段,整个流程一气呵成,有效训练时长占比超过90%。
摩尔线程高级副总裁董龙飞特别强调了“高精度”这一概念。这里的“高精度”,并非指单次计算的数值精度,而是模型在不同GPU平台间迁移训练时,能够实现结果对齐的能力——简而言之,即在相同的模型架构、训练数据和超参数设定下,能否获得稳定且可比的训练结果。这才是衡量平台迁移能力的关键所在。
摩尔线程提供的数据极具说服力:在DeepSeek这类MoE模型上,与国际主流GPU进行对比训练,前3万步的平均相对误差控制在万分之六以内。他们还利用500B到5T不等规模的数据进行了多轮实验,结论明确:在相同卡数、模型配置和训练流程下,基于摩尔线程平台训练出的模型,在后续的Benchmark评测中得分与参考平台基本持平,部分指标甚至有所超越。
另一个值得关注的案例,是摩尔线程与北京大学EvoPhys团队合作训练的5D世界模型EvoPhys-World。该模型基于MTT S5000完成全栈原生训练,在WorldScore的“世界生成”维度上连续37天位居榜首。这一项目获得了摩尔线程“灯塔计划”的支持,这不仅是中国科学家首次在中国算力设备上完成原创世界模型的研究工作,更是“国芯训国模”道路上一个真正的里程碑事件。
与此同时,北京智源研究院的RoboBrain 2.5具身大脑模型,也依托摩尔线程MTT S5000千卡智算集群,基于FlagOS-Robo框架,成功完成了全流程训练。这首次验证了国产算力集群在具身智能大模型训练中的高可用性与效率,其意义不言而喻。
摩尔线程创始人张建中,则用一个非常形象的比喻来描绘AI产业布局——按功能将产业拆分为三类“工厂”:模型训练工厂、词元生产工厂以及智能体生产工厂。这三者共用同一套全功能GPU架构,这也是摩尔线程与走专用芯片路线(ASIC)的厂商之间,最核心的区别所在。
在词元生产工厂方向,摩尔线程重点展示了基于MTT S5000的PD分离异构推理方案。具体来说,就是将算力需求较高的Prefill(预填充)计算部署在S5000上,而将带宽需求较高的Decode(生成)计算部署在国际主流GPU上,两者通过异构分池方式协同工作。张建中在演讲中给出的数据十分直观:异构组合后,整体吞吐量较原有方案提升了近2倍。他甚至总结出一个算式:“3台S5000+2台国际主流GPU≈9台国际主流GPU”。董龙飞补充道,这类异构方案的性能比任何同构方案都要高出50%以上,其中很大一部分收益来源于KV Cache的调度优化。在类似OpenClaw这样反复调用本机命令行工具的场景下,缓存命中率可达90%,相当于节省了90%的算力资源。
过去一年,国产大模型发布后到完成硬件适配的周期,已经从“数月”大幅压缩至“发布即适配”(Day 0适配)。部分大模型厂商现在会在模型规划部署阶段,就与摩尔线程同步开展“共研”合作,而非等到模型发布后才启动适配工作。这种变化,折射出整个产业链协作效率的显著提升。
在具身智能领域,早期的VLA/VLM类模型参数规模一般在5B到14B之间,主要部署在端侧。然而,当前的世界模型路线不再依赖语言输入,而是直接处理物理世界信息,参数跨度因此更大。要实现高质量的具身控制,大致需要10亿参数级别的模型在端侧运行,同时配合千亿级(1000B)及以上模型在云端协同工作。摩尔线程正基于自有万卡级集群,持续进行万亿参数模型的训练验证,不过具体进展和时间表尚未对外公布。
最后,谈及算力供应这一话题,董龙飞的观点十分明确:中国的算力建设是面向未来十到二十年的基础设施投入,短期内供不应求属于正常现象。以铁路、高速公路等基建项目作类比,中国GPU或算力企业远未发展到“供过于求”的阶段。这一判断,或许能为整个行业注入一剂强心针。
