AI算力瓶颈的破局之道:从模型放缓到国产算力突围
随着大模型技术从GPT-3演进到GPT-4,算力需求与模型能力同步呈现指数级增长。然而,GPT-4之后,无论OpenAI的新模型还是其他主流大模型,其算法能力提升似乎都进入了放缓甚至停滞阶段。这背后并非模型本身停止进步,而是支撑算法的算力系统遭遇了瓶颈。算力已成为AI发展的前哨与基石,如何突破这一瓶颈,尤其是在国产算力生态分散的背景下,成为业界关注焦点。本文将结合2024世界人工智能大会多位专家观点,深入剖析算力瓶颈根源,并探讨从芯片、算法到系统层的多种破局之道。
算力瓶颈的现状与根源
1. 表面放缓,实则算力遇阻
无问芯穹联合创始人兼CEO夏立雪指出,大模型能力增速放缓并非算法本身走到尽头,而是现有算力系统无法支撑下一代模型训练与推理需求。要推动模型进一步升级,必须重新研发构建更强大的算力基础设施。
2. 国内外生态差异:集中 vs 分散
为应对算力需求,国内外巨头纷纷投入万卡集群建设——微软、谷歌、Meta、OpenAI及国内百度、三大运营商等都在抢占这一高地。然而,国内外生态格局截然不同:
- 国外生态集中:算法厂商不超过10家,芯片厂商主要为英伟达和AMD,生态相对统一。
- 国内生态分散:算法层呈现“百模大战”,大量通用基座模型与行业模型并存;芯片层除英伟达和AMD,还有众多国产芯片厂商争相扩展市场。这种分散生态带来了“生态竖井”问题:不同芯片的硬件生态系统封闭且互不兼容,用A卡的开发者无法轻易迁移到B卡,也难以同时使用A、B两卡完成训练或推理。
3. “多芯片”≠“大算力”:异构算力的挑战
据统计,国内已有超一百个千卡集群在建或建成,其中大部分采用异构算力(混合多种芯片)。但异构芯片之间的通信和性能差异导致:
- 不同硬件平台适配不同的软件栈和工具链,开发者需为每种芯片定制代码,开发和维护复杂性剧增。
- “生态竖井”的存在使得多芯片并不能等价于大算力。
破局之道一:无问芯穹的异构千卡混训方案
针对异构芯片混训难题,无问芯穹提出完整解决方案,主要攻克两大挑战:
- 通信难题:异构卡之间的通信库差异,导致无法高效互联。
- 性能差异:不同芯片性能不均,导致分布式训练效率低下。
无问芯穹通过三项核心技术实现突破:
- 通用集合通信库:建立统一通信接口,实现不同芯片间的高效数据交换。
- 基于流水线并行的非均匀拆分方案:根据不同芯片的实际性能,智能分配计算任务,解决负载均衡问题。
- 自研混训性能预测工具:预测最优的非均匀拆分策略,指导千卡异构集群训练。
实际测试结果显示,无问芯穹千卡异构混合训练集群算力利用率最高达97.6%,证明异构混训在技术上完全可行。
