2025年7月25日,浪潮存储有点猛——直接甩出了国内首款推理加速存储AS3000G7。在信通院主办的产融合作大会上,浪潮存储营销总监张业兴不仅做了主题演讲,还正式发布了这款产品。它的核心逻辑只有四个字:“以存代算”。听起来简简单单,但确实打中了当下大模型推理中最让人头疼的痛点——KV Cache的重复计算。

大模型推理效能瓶颈:吞吐量和时延
大模型已经不是什么新鲜的概念了,从写文案到搞科研,几乎各行各业都在琢磨怎么把它用起来。但一个很现实的问题是:大家的注意力,正在从“怎么把模型训出来”,转向“怎么让模型反赌、跑得省”。IDC的数据也印证了这一点——未来五年智能算力规模要翻1.7倍,而推理工作负载的占比,预计从2023年的40%一路冲到2027年的70%以上。
说白了,推理才是未来大模型真正大规模落地的战场。
但问题也恰恰出在这里。推理跑在GPU上,而GPU是整个大模型落地中最烧钱的硬件。对于大多数企业来说,能不能把GPU的利用率拉到极致,直接决定了这套方案是“高性价比落地”,还是“实验室秀肌肉”。
那么问题来了,推理效率的瓶颈到底卡在哪里?说白了,就是两块:吞吐量和时延。
- 吞吐量——系统单位时间内能处理的token数量。这个数值越高,意味着同样的GPU资源能服务更多用户,单位成本自然就更低。
- 时延——用户接收每个token的平均耗时。尤其是首字时延(TTFT),在长文本对话场景中,它直接决定了用户会不会觉得“这AI反应真慢”。
大模型的推理过程其实分两个阶段。第一阶段是预填充(Prefilling),任务是把输入的上下文处理成初始的KV Cache(键值对缓存),放在GPU的HBM显存里。第二阶段是解码(Decode),利用之前生成的KV Cache,一步步迭代生成输出token。
这里的关键在于:超过76%的对话都是多轮的。每一轮对话产生的KV Cache,都会被下一轮拿来用。但问题是什么?GPU HBM显存容量极其有限——以DeepSeek 70B模型为例,每10分钟产生的KV Cache就高达25TB,而一张GPU的HBM显存只有几十GB。结果就是:每次服务完一个请求,显存就得清空,KV Cache被强制丢弃。下一轮对话时,原本可以复用的缓存不得不重算一遍。重复计算直接导致首字响应变慢、GPU算力空转、吞吐量下降。
这才是真正卡脖子的地方——KV Cache的管理效率,直接决定了推理效率的上限。
存储产品托管KV Cache,实现“以存代算”
浪潮存储这次拿出的AS3000G7,思路非常直接:与其让GPU反复重算,不如把这些KV Cache“存起来”。
它的架构设计是这样的:KV Cache先从GPU写入本机内存,再通过高速网络缓存到AS3000G7。下一轮对话时,直接按需从存储里拉取缓存数据,GPU不再需要重新计算。这套“以存代算”的逻辑,本质上是用存储换算力——而且从实际效果来看,这个交换非常划算。

作为国内首款推理加速存储产品,AS3000G7的优势相当清晰,主要体现在四个维度:
- 降低响应延迟:历史Token的KV Cache直接存在AS3000G7的NVMe SSD里,下轮对话直接拉取,GPU不用再算一遍。实际效果:TTFT降低90%。
- 承载更多并发:在TTFT不超过400ms的前提下,系统可支持的吞吐量(Token/s)能达到原方案的5倍。同样一块GPU,能干更多的活。
- 降低GPU功耗:TTFT降低、并发提升,带来的直接结果是单Token平均功耗下降60%。承载同等规模token负载时,整机功耗明显降低,这可不是小数目。
- 生态兼容适配:不管是国产芯片还是海外芯片的异构算力平台,都能兼容。深度适配vLLM框架下的DeepSeek等主流大模型,部署起来没有额外成本。
在某头部客户的联合测试中,采用1台GPU服务器搭配1台AS3000G7的组合方案,结果相当亮眼:
- 稳定支撑500+并发对话,TTFT降低90%
- 同硬件配置下,吞吐量提升5倍,不增GPU资源,推理并发直接翻番
- 单token功耗降低70%,单位算力成本降低60%

回过头来看,大模型推理需求还在继续暴涨,AS3000G7这个时间点推出,时机拿捏得相当准。“以存代算”这套技术路线,虽然听起来简单,但确实捅破了KV Cache重计算这层窗户纸。随着多模态和实时交互场景越来越普及,存储与计算的协同优化只会越来越关键。可以确定的是,“以存代算”正在成为大模型降本增效的核心竞争力,也为智能时代的推理存储提供了新的基准线。
