游乐游手机版
首页/业界动态/文章详情

超智融合新范式:清程极智基于灵晟超算纯CPU MoE模型分布式推理

时间:2026-08-06 11:48
清程极智基于“灵晟”超算实现纯CPUMoE模型分布式推理。LX2CPU集成矩阵加速单元与片上高带宽内存,自研网络支持微秒级低时延传输。通过算子优化与多层次并行,16节点运行DeepSeek-V3 R1-671B模型,输出吞吐量媲美80张GPU集群,64节点长文本任务TPOT低于55毫秒,8192节点并行效率超74%。

在高性能计算与人工智能走向深度融合的产业浪潮中,构建“超智一体”的基础设施,早已不是一道选择题,而是关乎产业升级的核心命题。最近,一个名为“灵晟”的国产超算系统,凭借其超智融合的体系架构创新,登顶全球超算TOP500榜单,并与清程极智合作,打造出一套纯CPU的MoE模型分布式推理方案。它真正打破了HPC与AI之间的算力墙——既能在科学计算领域稳坐头把交椅,又能在AI大模型推理中展现令人印象深刻的性能。可以说,“灵晟”正在重新定义什么才是“好用、易用”的超智融合算力平台。

那么,为什么要把AI大模型跑在超算上?产业需求给出了两个核心驱动力:一是方法融合,当科学计算的物理模型与数据驱动的AI深度结合,往往会催生出碘伏性的科研成果;二是效能提升,超算平台通过错峰运行AI任务,能够最大化地利用算力资源。从这个角度看,“灵晟”最亮眼的地方,恰恰在于其架构层面的原生超智融合。

在算力侧,它没有走传统路径——单纯堆砌专用加速卡,而是在自研的LX2 CPU中集成了矩阵加速单元,并支持多精度计算,实现了HPC算力与AI算力在芯片上的深度融合。更关键的是,CPU集成了片上高带宽内存,能提供TB级带宽,相比传统CPU实现了十倍以上的跃升,为大模型推理中的大批量并发处理提供了充足的带宽保障。

在网络侧,自研的“灵启”网络支持微秒级低时延传输,具备可扩展至200万端口、10万节点的超大规模组网能力。这种极低时延、极高扩展性的互联特性,有效消除了分布式推理中的通信瓶颈,让大规模并行计算不再受限于网络。

当然,硬件创新只是第一步。LX2 CPU与GPU、NPU架构存在本质差异,要把大模型从“专卡”平滑迁移到“通卡”,软件层面的挑战同样不容小觑。

HPC与AI虽然属于不同的计算范式,但在核心优化思路上其实是相通的——都依赖算子优化、计算与访存重叠、流水线并行及多级并行等手段,来充分释放硬件性能。结合“灵晟”平台的硬件特性与自研软件,清程极智从多个技术维度对大模型推理进行了深度加速。

首先是面向LX2 CPU的算子开发与优化。针对“灵晟”自研软硬件,团队完成了算子重构:基于LX2 CPU的矩阵运算指令集,结合OpenMP与自研编译器实现计算算子;基于自研通信库构建通信算子。借助自研的统一并行加速库——它具备计算图语义扩展、共享内存通信加速、多线程调度优化及硬件特性抽象等核心能力——团队实施了精细化的指令序列控制,应用计算掩藏访存、异步流水线调度等优化策略。对于无依赖关系的多个算子,团队切分线程池,分布线程并行度,让少数线程负责并行度低的算子,多数线程负责并行度高的算子。例如,Shared expert与EP通信同时进行,实测显示,MoE推理时延从1440μs大幅降低至980μs,效果立竿见影。

其次是面向“灵晟”集群的多层次并行推理优化。LX2 CPU采用NUMA架构并集成片上内存,结合“灵启”网络的强劲互联能力,与DeepSeek的大规模专家并行(EP)架构天然契合,极佳的集群扩展性由此而来。基于此,团队实施了多维度的并行策略优化:灵活配置张量并行(TP)、流水线并行(PP)、专家并行(EP)及数据并行(DP),构建了多层次混合并行推理方案。在DeepSeek部署上,团队采用EP256的大规模专家并行配置,专家权重的全量分散部署,节点内TP16,节点间DP16,并针对Attention模块设计了定制化混合并行策略,充分释放了LX2平台的算力密度与通信能力。

超智融合新范式:清程极智基于“灵晟”超算实现纯CPU MoE模型分布式推理

此外,MTP(Multi-Token Prediction)技术的引入也值得一提。在上述优化基础上,团队引入了DeepSeek MTP加速技术,一次推理能够产生多个token,再并行验证每个token是否正确,显著提升了单请求的输出速率。团队还深入探究了不同并发规模下MTP加速比与预测深度的相关性,持续调优以实现最佳推理效果。

基于“灵晟”多样性算力架构的创新与清程极智的AI推理加速技术,DeepSeek模型的高效部署得以实现,率先完成了纯CPU MoE模型分布式推理。16节点即可流畅运行DeepSeek-V3/R1-671B模型,在batch_size=2048时,输出吞吐量与80张主流GPU集群相当。

针对规模化部署DeepSeek的场景,“灵晟”研发团队正在基于SGLang推理引擎进行深度优化。最新测试数据显示,在64节点规模下处理长文本摘要任务时,TPOT(每输出token时延)在55ms以内,单CPU Decode吞吐达586.8 TPS;节点规模从64节点扩容至8192节点时,并行效率超过74%,这充分印证了“灵晟”系统极强的可扩展性。

这意味着,“灵晟”不仅能同时支撑HPC与AI工作负载,更兼具卓越的性能表现与极高的经济性。这不仅从技术底层重塑了超智融合范式,更以此为支点,为各行业复杂场景提供精准、高效的计算支撑,全面释放超智算力潜能,加速科研与产业数智化升级。

来源:https://www.ithome.com/0/984/387.htm
上一篇年7月电影票房破50亿,《功夫女足》《八仙!》《蜘蛛侠:崭新之日》前三 下一篇告别流量泡沫 2026企业传播体系重构 炬宝GEO领跑可信GEO新赛道
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
台式机加装固态硬盘怎么选?三星9100 PRO深度解析
业界动态 · 2026-09-01

台式机加装固态硬盘怎么选?三星9100 PRO深度解析

台式机升级存储常受限于系统启动慢、游戏加载卡顿与大文件传输延迟。本文基于三星9100 PRO的PCIe 5 0架构、14800MB s读取、13400MB s写入、2200K 2600K IOPS、1TB~8TB容量、第八代V-NAND与5nm主控、镍涂层散热与DTG技术、散热片版适配及魔术师软件,提供选购判断与安装兼容性要点,帮助读者评估是否值得一步到位升级。

宁德时代2026年中期分红61.8亿元,同比增35%,创历史新高
业界动态 · 2026-09-01

宁德时代2026年中期分红61.8亿元,同比增35%,创历史新高

宁德时代发布2026年中期分红方案,总额达61 8亿元,同比增长35%。本文梳理分红具体安排、历史对比、业绩支撑及分红机制,帮助投资者评估公司现金流实力与股东回报策略。

企业硬盘报废销毁合规指南:如何选择专业机构与处理流程
业界动态 · 2026-08-31

企业硬盘报废销毁合规指南:如何选择专业机构与处理流程

企业硬盘报废面临数据复原与合规风险,需选择具备资质且流程透明的专业机构。本文解析行业乱象,介绍以团体标准为核心的合规销毁流程,涵盖上门收运、消磁粉碎、视频溯源及尾料处置,帮助企业规避泄密责任,确保数据安全闭环。

机密文件销毁找什么机构?认准团标参编与资质合规
业界动态 · 2026-08-31

机密文件销毁找什么机构?认准团标参编与资质合规

机密文件销毁找什么机构?核心在于甄别服务商是否具备正规保密资质及是否参与行业标准制定。本文解析《商业秘密及敏感信息载体销毁通用规范》团标要求,提供筛选销毁机构的实操指南,帮助企业规避数据泄露风险,确保销毁流程合规可溯。

影石Insta360 X6全球首销登顶:8K全景画质与AI创作功能解析
业界动态 · 2026-08-31

影石Insta360 X6全球首销登顶:8K全景画质与AI创作功能解析

影石Insta360 X6全球同步发售即登顶国内外主流平台销量榜首。本文解析其搭载的索尼定制方形大底传感器、4nm AI三芯架构及8K50fps画质,详解3D时光舱、AI导演等独家功能,探讨全景相机从专业工具向大众智能创作设备的演进趋势。