游乐游手机版
首页/业界动态/文章详情

浪潮存储发布国内首款大模型推理加速存储AS3000G7

时间:2026-07-19 12:22
2025年7月,浪潮存储发布国内首款推理加速存储AS3000G7,采用以存代算理念,将KVCache存于NVMeSSD,避免GPU重复计算。实际测试中,TTFT降低百分之九十,吞吐量提升五倍,单token功耗降低百分之七十,单位算力成本降低百分之六十,大幅提升推理效率并降低成本。

2025年7月25日,浪潮存储有点猛——直接甩出了国内首款推理加速存储AS3000G7。在信通院主办的产融合作大会上,浪潮存储营销总监张业兴不仅做了主题演讲,还正式发布了这款产品。它的核心逻辑只有四个字:“以存代算”。听起来简简单单,但确实打中了当下大模型推理中最让人头疼的痛点——KV Cache的重复计算。

大模型推理效能瓶颈:吞吐量和时延

大模型已经不是什么新鲜的概念了,从写文案到搞科研,几乎各行各业都在琢磨怎么把它用起来。但一个很现实的问题是:大家的注意力,正在从“怎么把模型训出来”,转向“怎么让模型反赌、跑得省”。IDC的数据也印证了这一点——未来五年智能算力规模要翻1.7倍,而推理工作负载的占比,预计从2023年的40%一路冲到2027年的70%以上。

说白了,推理才是未来大模型真正大规模落地的战场。

但问题也恰恰出在这里。推理跑在GPU上,而GPU是整个大模型落地中最烧钱的硬件。对于大多数企业来说,能不能把GPU的利用率拉到极致,直接决定了这套方案是“高性价比落地”,还是“实验室秀肌肉”。

那么问题来了,推理效率的瓶颈到底卡在哪里?说白了,就是两块:吞吐量和时延。

  • 吞吐量——系统单位时间内能处理的token数量。这个数值越高,意味着同样的GPU资源能服务更多用户,单位成本自然就更低。
  • 时延——用户接收每个token的平均耗时。尤其是首字时延(TTFT),在长文本对话场景中,它直接决定了用户会不会觉得“这AI反应真慢”。

大模型的推理过程其实分两个阶段。第一阶段是预填充(Prefilling),任务是把输入的上下文处理成初始的KV Cache(键值对缓存),放在GPU的HBM显存里。第二阶段是解码(Decode),利用之前生成的KV Cache,一步步迭代生成输出token。

这里的关键在于:超过76%的对话都是多轮的。每一轮对话产生的KV Cache,都会被下一轮拿来用。但问题是什么?GPU HBM显存容量极其有限——以DeepSeek 70B模型为例,每10分钟产生的KV Cache就高达25TB,而一张GPU的HBM显存只有几十GB。结果就是:每次服务完一个请求,显存就得清空,KV Cache被强制丢弃。下一轮对话时,原本可以复用的缓存不得不重算一遍。重复计算直接导致首字响应变慢、GPU算力空转、吞吐量下降。

这才是真正卡脖子的地方——KV Cache的管理效率,直接决定了推理效率的上限。

存储产品托管KV Cache,实现“以存代算”

浪潮存储这次拿出的AS3000G7,思路非常直接:与其让GPU反复重算,不如把这些KV Cache“存起来”。

它的架构设计是这样的:KV Cache先从GPU写入本机内存,再通过高速网络缓存到AS3000G7。下一轮对话时,直接按需从存储里拉取缓存数据,GPU不再需要重新计算。这套“以存代算”的逻辑,本质上是用存储换算力——而且从实际效果来看,这个交换非常划算。

作为国内首款推理加速存储产品,AS3000G7的优势相当清晰,主要体现在四个维度:

  • 降低响应延迟:历史Token的KV Cache直接存在AS3000G7的NVMe SSD里,下轮对话直接拉取,GPU不用再算一遍。实际效果:TTFT降低90%。
  • 承载更多并发:在TTFT不超过400ms的前提下,系统可支持的吞吐量(Token/s)能达到原方案的5倍。同样一块GPU,能干更多的活。
  • 降低GPU功耗:TTFT降低、并发提升,带来的直接结果是单Token平均功耗下降60%。承载同等规模token负载时,整机功耗明显降低,这可不是小数目。
  • 生态兼容适配:不管是国产芯片还是海外芯片的异构算力平台,都能兼容。深度适配vLLM框架下的DeepSeek等主流大模型,部署起来没有额外成本。

在某头部客户的联合测试中,采用1台GPU服务器搭配1台AS3000G7的组合方案,结果相当亮眼:

  • 稳定支撑500+并发对话,TTFT降低90%
  • 同硬件配置下,吞吐量提升5倍,不增GPU资源,推理并发直接翻番
  • 单token功耗降低70%,单位算力成本降低60%

回过头来看,大模型推理需求还在继续暴涨,AS3000G7这个时间点推出,时机拿捏得相当准。“以存代算”这套技术路线,虽然听起来简单,但确实捅破了KV Cache重计算这层窗户纸。随着多模态和实时交互场景越来越普及,存储与计算的协同优化只会越来越关键。可以确定的是,“以存代算”正在成为大模型降本增效的核心竞争力,也为智能时代的推理存储提供了新的基准线。

来源:https://www.icloudnews.net/a/102430.html
上一篇三星Galaxy Z Fold7专业级超清影像背后故事 下一篇达明机器人联合海峡经济科技合作中心亮相2025世界人工智能大会
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
王坚九问九答:中美AI从泳池到同一片大海
业界动态 · 2026-07-19

王坚九问九答:中美AI从泳池到同一片大海

2026智源大会上,王坚与黄铁军展开对话。王坚认为应超越“AI”框架,在动物、人类与机器智能的更大框架下思考,坚信AI不会替代人类,并指出如今中美面对的是同一片大海。黄铁军建议从业者要有自己的想法,并在该下决心时果断决策。

拓普集团同心圆模式如何突破效率墙发展瓶颈
业界动态 · 2026-07-19

拓普集团同心圆模式如何突破效率墙发展瓶颈

拓普集团2016年不及中鼎股份,2025年全面反超;但2026年营收创新高利润首降,毛利率跌破行业均值。机器人30万套产能年收入仅1359万元,一季度毛利率续降至19 26%。

比亚迪闪充技术布局加拿大市场充电桩先行
业界动态 · 2026-07-19

比亚迪闪充技术布局加拿大市场充电桩先行

比亚迪在加拿大未正式售车,但已启动闪充网络布局,招聘闪充业务发展经理,负责成本模型、合作伙伴及电网升级。全球规划中,欧洲为重点市场,加拿大政策对中国车企持开放态度。

极狐贝塔T1纯电小车6万级焕新,官方暗示玩大的
业界动态 · 2026-07-19

极狐贝塔T1纯电小车6万级焕新,官方暗示玩大的

极狐T1焕新升级为贝塔T1,将于6月16日上市。尾部改为贯穿式尾灯,配大尺寸运动尾翼,运动感增强。官方暗示空间或电池可能升级。现款售价6 28-8 78万元,提供320km和425km续航,轴距2770mm,空间越级,配置丰富,上市首月订单超3 5万台。

三星Galaxy Z Fold8 Ultra等三款折叠屏手机机模曝光
业界动态 · 2026-07-19

三星Galaxy Z Fold8 Ultra等三款折叠屏手机机模曝光

科技博主曝光三星三款折叠新机模型,包括ZFlip8、ZFold8及ZFold8Ultra。ZFlip8与Fold8Ultra延续前代设计,边框有望收窄。标准版ZFold8首次采用宽折叠方案,外屏更短但宽度翻倍,展开后获得7 6英寸接近4:3比例的屏幕,提升多任务与视频观看体验。目前展示的仍为早期模型。