随着AI大模型持续迭代升级,行业对算力和内存容量的需求快速攀升,内存芯片采购成本也随之显著上涨。业内普遍认为,为了控制整体支出,各大科技巨头正通过软件优化和系统级改进,尽可能降低AI数据处理过程中的内存占用,从而实现AI基础设施降本增效。

据媒体近日报道,谷歌、英伟达、微软等头部科技公司已陆续推出数据压缩、内存负载分流等内存优化技术,以应对AI业务高速增长带来的内存压力和成本挑战。
多种技术
谷歌研究院于今年3月推出的TurboQuant算法,是当前较具代表性的AI内存优化方案。该技术可将AI推理过程中产生的键值(KV)缓存压缩至3-4比特,从而降低DRAM负载与计算压力。
从应用层面看,可以将其理解为借助特殊量化算法,用更小的存储空间保存AI推理阶段的临时数据,在不改动原有模型的情况下有效减少内存消耗。
业内人士指出,在无需对AI模型进行重新训练的前提下,相较现有方案,该技术最高可将内存使用量压缩至原有水平的六分之一。
英伟达则于3月正式发布上下文记忆存储平台(CMX)平台方案,通过增设独立存储层来缓解内存压力。
业内指出,该方案依托数据处理单元(DPU)构建共享CMX平台,将原本集中存放于高带宽内存(HBM)中的计算数据进行分流,目的在于避免HBM过载,同时提升整体能效表现。
微软近期也披露了IndexMem技术,该技术会在推理阶段筛选优先级相对较低的数据并进行压缩处理。
与此同时,学术界还推出了被视为主流备选方案之一的EVICPRESS系统。该系统会将键值缓存分散存储到HBM、普通DRAM、固态硬盘(SSD)等多层存储介质中,再依据上下文的重要性对数据进行压缩或删除。
可以将其理解为把AI临时缓存分流到速度快慢不同的存储设备中,优先保障关键数据访问效率,以此缓解HBM承压问题。
上述多项AI内存优化技术均于今年上半年陆续公布,不过截至目前,尚无明确信息显示其已实现大规模商业化落地。
成本压力倒逼技术优化
内存价格持续上涨,正在倒逼大型科技企业进一步削减内存消耗,并加快推进AI系统架构优化。
摩根士丹利最新预测显示,2026年第三季度DDR4等成熟DRAM价格预计将环比大涨50%,到第四季度还将继续上涨10%。
该机构认为,成熟DRAM芯片的供应紧张局面接下来还可能进一步加剧。
据韩国券商iM证券测算,今年全球前十五大科技巨头的资本开支总预算中,存储芯片采购占比达到37%,相比去年15%的占比提升约2.5倍。
有媒体指出,内存成本上行也正在对大型科技企业的自由现金流造成明显拖累。
谷歌母公司Alphabet受AI基础设施投入扩大的影响,今年第二季度录得公司历史上首次负自由现金流。为应对这一局面,Alphabet于本月初发行约250亿美元公司债进行融资。
英伟达也在6月发行了至少200亿美元公司债,这是其近五年来首次发债,主要用于覆盖AI基础设施建设相关开支。
一位业内人士表示:“大型科技企业如今已经进入一个仅靠经营活动产生的现金流,难以覆盖AI基础设施投入需求的阶段。未来,谁能提升有限芯片资源的利用效率,谁就更有可能在盈利能力竞争中占据优势,而内存优化技术将成为决定企业盈利水平的重要胜负手。”
