游乐游手机版
首页/AI热点日报/热点详情

国产算力瓶颈破局:无问芯穹等谈芯片模型生态分散

类型:热点整理2026-07-25
大模型能力放缓源于算力系统瓶颈。国产算力面临生态分散、异构芯片难以高效利用等挑战。破局之道包括:无问芯穹实现97 6%算力利用率的异构混训方案;沐曦提出算法革新与先进封装;壁仞强调硬件、有效算力、聚合算力三维度系统化破局。

AI算力瓶颈的破局之道:从模型放缓到国产算力突围

随着大模型技术从GPT-3演进到GPT-4,算力需求与模型能力同步呈现指数级增长。然而,GPT-4之后,无论OpenAI的新模型还是其他主流大模型,其算法能力提升似乎都进入了放缓甚至停滞阶段。这背后并非模型本身停止进步,而是支撑算法的算力系统遭遇了瓶颈。算力已成为AI发展的前哨与基石,如何突破这一瓶颈,尤其是在国产算力生态分散的背景下,成为业界关注焦点。本文将结合2024世界人工智能大会多位专家观点,深入剖析算力瓶颈根源,并探讨从芯片、算法到系统层的多种破局之道。

算力瓶颈的现状与根源

1. 表面放缓,实则算力遇阻

无问芯穹联合创始人兼CEO夏立雪指出,大模型能力增速放缓并非算法本身走到尽头,而是现有算力系统无法支撑下一代模型训练与推理需求。要推动模型进一步升级,必须重新研发构建更强大的算力基础设施。

2. 国内外生态差异:集中 vs 分散

为应对算力需求,国内外巨头纷纷投入万卡集群建设——微软、谷歌、Meta、OpenAI及国内百度、三大运营商等都在抢占这一高地。然而,国内外生态格局截然不同:

  • 国外生态集中:算法厂商不超过10家,芯片厂商主要为英伟达和AMD,生态相对统一。
  • 国内生态分散:算法层呈现“百模大战”,大量通用基座模型与行业模型并存;芯片层除英伟达和AMD,还有众多国产芯片厂商争相扩展市场。这种分散生态带来了“生态竖井”问题:不同芯片的硬件生态系统封闭且互不兼容,用A卡的开发者无法轻易迁移到B卡,也难以同时使用A、B两卡完成训练或推理。

3. “多芯片”≠“大算力”:异构算力的挑战

据统计,国内已有超一百个千卡集群在建或建成,其中大部分采用异构算力(混合多种芯片)。但异构芯片之间的通信和性能差异导致:

  • 不同硬件平台适配不同的软件栈和工具链,开发者需为每种芯片定制代码,开发和维护复杂性剧增。
  • “生态竖井”的存在使得多芯片并不能等价于大算力

破局之道一:无问芯穹的异构千卡混训方案

针对异构芯片混训难题,无问芯穹提出完整解决方案,主要攻克两大挑战:

  • 通信难题:异构卡之间的通信库差异,导致无法高效互联。
  • 性能差异:不同芯片性能不均,导致分布式训练效率低下。

无问芯穹通过三项核心技术实现突破:

  1. 通用集合通信库:建立统一通信接口,实现不同芯片间的高效数据交换。
  2. 基于流水线并行的非均匀拆分方案:根据不同芯片的实际性能,智能分配计算任务,解决负载均衡问题。
  3. 自研混训性能预测工具:预测最优的非均匀拆分策略,指导千卡异构集群训练。

实际测试结果显示,无问芯穹千卡异构混合训练集群算力利用率最高达97.6%,证明异构混训在技术上完全可行。

来源:https://m.elecfans.com/article/3793593.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。