浪潮信息AIGC存储解决方案:打造大模型时代的算存均衡底座
2023年6月28日,浪潮信息“元脑中国行”全国巡展杭州站正式举办。会上,浪潮信息重磅发布基于新一代分布式存储平台 AS13000G7 的 AIGC存储解决方案。该方案通过融合EPAI/AIStation的资源调度能力与AS13000G7自身的产品优势,旨在解决大模型应用对存储性能、容量以及数据管理的苛刻要求。同时,浪潮信息首次提出GPU计算集群算力与存储集群聚合带宽的推荐配比,实现关键检测点数据在 60秒内 写入和读取恢复,显著提升大模型训练效率。
大模型时代:数据基础设施面临全新挑战
随着数字经济的蓬勃发展,AI技术正成为推动企业业务变革和创新的核心引擎。大模型作为驱动数字经济深度创新、引领企业业务变革、加速形成新质生产力的关键动能,对底层数据基础设施提出了前所未有的高要求。
在杭州站现场,浪潮信息存储产品线副总经理刘希猛指出:随着大模型参数量和数据集规模的极速膨胀,多源异构数据的传、用、管、存已成为生成式AI落地的瓶颈之一。在AI大模型的数据归集、训练、数据归档与管理等阶段,用户普遍面临三大新挑战:
- 数据归集时间长:海量异构数据从分散源汇聚到训练集群,耗时过长。
- 模型训练效率低:存储系统带宽不足、延迟高,导致GPU算力空闲等待。
- 数据管理复杂度高:多协议、多层级数据的流转与管理缺乏统一方案。
正因如此,用户亟需构建一个支持多协议、高带宽、低延迟、数据高效流转的 大模型存储底座。
作为业界率先提出分布式融合存储的厂商,浪潮信息聚焦行业客户的大模型落地痛点,打造了基于NVMe SSD高效适配与优化的 分布式全闪存储AS13000G7-N系列。该系列依托自研分布式文件系统构建了新一代数据加速引擎 DataTurbo,在缓存优化、空间均衡、缩短GPU与存储读取路径等方面进行了全面升级,能够提供 TB级带宽、千万级IOPS、EB级容量,充分满足大模型存储在性能和容量上的严苛要求。
剑指AIGC主战场:基于AS13000G7的AIGC存储解决方案
在大模型数据处理全流程中,想要将训练效率发挥到极致、减少不必要的资源浪费,必须实现 算力与存力的均衡配置。而训练阶段的数据读写性能,是存力发挥最大作用的关键。为此,浪潮信息推出基于AS13000G7的AIGC存储解决方案,该方案通过AIStation人工智能平台进行智能资源调度和深度数据管理,并与EPAI“元脑企智”平台深度集成,使数据在 热、温、冷、冰 四个存储资源池中高效流动,从而最大限度满足AIGC不同阶段对高性能、易管理的存储需求。
1. 深度定制:与上层EPAI/AIStation协同
通过智能数据预读、智能故障处理等技术的深度定制,为行业用户提供经过验证的、更加成熟的存储整体方案。目前该方案已累计服务AIGC用户超 100家,其中百PB级用户超 10家。
2. 横向数据自由流动:提升效率,降低TCO
借助全局命名空间、多协议实时互通、数据冷热分层等技术,实现数据在不同存储池之间的横向自由流动,提升存储效率并降低用户TCO 20%以上,整体方案更加简约。
3. 纵向数据高效访问:缩短训练时间
利用AS13000G7-N系列强大的智能缓存优化、智能空间均衡和GPU直通存储等优势,实现纵向数据高效访问,缩短大模型训练时间 50%,方案更加高效。
凭借成熟的深度定制能力、卓越的产品性能以及数据全生命周期管理能力,浪潮信息基于AS13000G7的AIGC存储解决方案完美平衡了大模型训练阶段的高性能需求与归档阶段的低成本需求。

算存黄金比例:加速大模型训练的关键
倪光南院士曾指出:“对于AI智能计算中心来说,要想均衡配置存力、算力和运力,必须注意比例相当,不能失调,才能取得最大的经济和社会效益。” 为了充分发挥大模型潜能,解决存算比例不平衡的难题,浪潮信息在最新的AIGC存储解决方案中给出了明确的配置推荐。
性能配比:GPU算力与存储带宽的黄金比例
大模型训练过程中,检测点(Checkpoint)文件的读写对存储系统性能构成巨大挑战。以万亿参数模型为例,其模型参数可达 12~13TB,未经优化的存储集群写入一次检测点需要耗费 3小时。为了将检测点写入与恢复时间控制在 60秒以内,浪潮信息通过大量实践得出推荐配比:
- 推荐配比:前端GPU计算集群算力(单位:PFLOPS)与存储集群聚合带宽(单位:TB/s)的 比例为 35:1。
- 如果期望进一步降低CHK写入和恢复时间,可继续增加集群带宽,但收益会逐渐递减。
全闪容量配置:合理规划热、温、冷存储池
模型训练场景中,除了初始加载的训练数据集需要存放在全闪池(热池)外,过程训练中的Checkpoint数据也需要保存。随着万卡时代的到来,掉卡或训练中止现象时有发生,用户通常每隔一段时间保存一次检测点数据,用于恢复训练或模型评估推理。基于一年多的实践经验,浪潮信息建议:
- Checkpoint频率:每 2~4小时 做一次。
- 保存周期:检测点数据保留 两周。
- 通过模型分析与产品特点相结合,可以推算出全闪热存储池的容量要求。
- 温冷池容量:用于原始数据收集、准备(温池)以及归档(冷池)的存储池,其容量一般为热存储池的 10~20倍,可达百PB级。
小提示
- 如果您的GPU集群算力较高但存储带宽不足,建议优先按照35:1的比例升级存储集群聚合带宽,否则GPU利用率会因等待I/O而大幅下降。
- 对于Checkpoint保存策略,请根据训练任务的稳定性和恢复时间要求灵活调整频次:任务越不稳定,建议缩短保存间隔(如2小时);反之可延长至4小时。
- 冷数据归档可采用更低成本的大容量存储(如HDD),进一步降低整体TCO。
常见问题(FAQ)
- 问:为什么检测点写入时间如此重要?
答:在大模型训练中,检测点用于保存训练状态,一旦发生故障(如GPU掉卡),可从最近检测点恢复训练。若写入/恢复时间过长(如数小时),会严重浪费GPU算力并拖慢整体训练进度。将时间压缩到60秒内,能极大提升训练效率。 - 问:35:1的算存配比是否适用于所有大模型?
答:该配比是基于万亿参数级模型和全闪存储AS13000G7的实际测试得出的参考值。对于不同模型架构、训练框架(如Megatron、DeepSpeed)以及检测点策略,可能会略有波动,但作为初始规划的黄金比例非常具有指导意义。建议用户在部署前使用实际数据集进行小规模验证。 - 问:热、温、冷、冰四个存储资源池具体如何划分?
答:热池:存放当前训练任务频繁访问的数据(如训练数据集、实时检测点),使用全闪NVMe SSD;温池:存放原始数据、预处理后的中间数据,可使用混合闪存或大容量SSD;冷池:存放历史归档模型、不常用的训练数据,使用高密度HDD;冰池:极冷数据(如长期备份),可使用磁带或云归档。具体划分需根据业务访问频率决定。 - 问:浪潮信息AIGC存储解决方案是否已经有成功案例?
答:是的。截至发布,该方案已累计服务AIGC用户超100家,其中百PB级规模用户超过10家,覆盖互联网、科研、金融等多个行业,验证了方案的成熟度和可靠性。
结语:加速大模型落地,从“存算均衡”开始
在“元脑中国行”杭州站现场,来自天目山实验室、网易伏羲、英特尔等机构的300余位专家、学者及产业领袖,围绕生成式AI、AI for Science、大模型AIGC应用等热点话题进行了深入交流。同时,浪潮信息举行了“EPAI种子计划”签约仪式,名都科技、启帆信息、图灵软件、天健远见等10家浙江区域的元脑伙伴正式加入该计划,共同推动AI应用的创新发展与大模型落地实践。
大模型时代,存储不再是配角。浪潮信息基于AS13000G7的AIGC存储解决方案,通过算存黄金比例、全生命周期数据管理以及深度生态集成,为行业用户提供了一条清晰、可落地的训练效率提升路径。无论您是正在规划AI基础设施的CTO,还是正在苦恼训练效率的算法工程师,都不妨从“35:1”这个数字开始,重新审视您的存力配置。
