游乐游手机版
首页/AI热点日报/热点详情

Kimi K3的KDA机制提升注意力效率,但需更多GPU、HBM、DRAM和网络,而非更少

类型:热点整理2026-07-20
月之暗面KimiK3模型采用线性注意力机制,但超2 8万亿参数和64芯片扩展域架构反而推高GPU、HBM、DRAM及网络设备需求。杰文斯悖论显示,效率提升降低推理成本,促进应用规模扩大,长期刺激高端AI硬件需求增长。

月之暗面旗下的Kimi K3模型,因为采用了线性注意力机制,最近在市场上引起了一些连锁反应——有人开始担心,这会不会削弱对英伟达、HBM以及网络设备的需求。

但半导体研究机构SemiAnalysis给出了一个截然不同的判断:K3庞大的参数规模和推理架构需求,不仅不会冲淡高端AI硬件需求,反而可能让英伟达高端GPU、HBM以及高速互联设备的需求变得更加强烈。

先看几个核心数字:K3的参数规模超过2.8万亿,模型权重容量就超过1.5TB的HBM。即便是在相对有限的用户并发场景下,KV缓存仍然需要大量卸载到CPU DDR5内存和NVMe存储上,HBM空间根本谈不上什么富余。

更关键的是,月之暗面此前透露过,K3要实现高效推理部署,至少需要64颗芯片组成的大规模扩展域架构。这个硬件需求,与英伟达GB200/GB300 NVL72这类机架级AI系统的设计思路,可以说是高度吻合。

SemiAnalysis认为,市场把线性注意力简单理解为“削弱GPU需求”,这个逻辑本身就存在偏差。真正的影响很可能恰恰相反:更高效的模型架构降低了AI推理成本,反而会推动更多应用落地,进而刺激GPU、HBM、DRAM以及网络基础设施的长期需求。

无惧线性注意力迭代,英伟达芯片需求依旧坚挺

市场的担忧,主要来自Kimi K3采用的Kimi Delta Attention(KDA)机制。

与传统Transformer注意力机制相比,KDA可以显著降低KV缓存的数据传输需求,最高能减少约10倍的网络带宽压力。这个变化让不少投资者联想到了DeepSeek R1发布后市场对AI硬件需求的担忧——模型效率提升,会不会降低对高端算力硬件的依赖?

但SemiAnalysis认为,这个判断忽略了大模型推理中的另一个核心需求:参数规模带来的计算和互联压力。

K3拥有超过2.8万亿参数,模型权重本身就需要依赖大规模分布式计算系统才能部署。与此同时,K3采用了WideEP(Wide Expert Parallelism)优化策略,将896个专家模块分布到多颗GPU上,让单颗GPU只承载部分专家权重,从而提升计算利用率。

不过,WideEP也带来了新的挑战:专家之间频繁的数据交换,需要更强大的网络互联能力。SemiAnalysis指出,GB200/GB300 NVL72采用的铜背板互联架构,机架内带宽达到传统DGX B200系统的18倍,非常适合这类大规模专家并行推理任务。

换句话说,KDA节省的KV缓存通信需求,很可能被WideEP带来的权重交换需求部分抵消,整体AI基础设施的压力并没有明显下降。

64颗芯片扩展域并非英伟达独家受益

当然,市场对此也有不同声音。知情人士GDP(@bookwormengr)指出,月之暗面提到的“64颗芯片扩展域”,并不一定就意味着英伟达的NVL72方案。华&为昇腾950 SuperPod同样采用64颗芯片配置,并且具备类似NVLink的统一总线(UB)内存扩展能力。

从架构能力来看,昇腾950 SuperPod可以支持跨16个机架扩展到1024颗NPU,在满足大规模模型推理需求方面同样有竞争力。因此,K3带来的硬件需求增长,并不意味着英伟达会成为唯一受益者,但高端AI互联系统的需求强化趋势,这一点是明确的。

杰文斯悖论:AI效率提升可能推动硬件需求增长

SemiAnalysis进一步引用杰文斯悖论(Jevons' Paradox)来解释AI基础设施的趋势。

这个理论的核心是:当某项技术提升了资源利用效率、降低了单位成本后,需求往往不会下降,反而会因为应用范围扩大而增长。放到AI领域,线性注意力机制降低了推理成本,可能会推动更多企业部署AI应用,全球AI推理规模进一步扩大,最终带动GPU、HBM、DRAM以及高速网络设备的需求增长。

不过,GDP对此保持谨慎。他认可杰文斯悖论的长期逻辑,但指出KDA在长上下文任务中的状态存储优化具有现实意义。即使模型权重规模巨大,由于采用了4bit量化以及高度稀疏化设计,实际内存压力可能低于市场直觉。

他认为,真正值得关注的变量,在于全球推理需求最大的AI公司——OpenAI、Anthropic以及Google DeepMind——是否已经或未来会采用类似KDA、DeepSeek CSA/HCA等线性注意力方案。如果头部AI公司大规模采用这类架构,长上下文推理对内存和互联资源的需求可能会出现明显下降,这将成为影响未来AI硬件需求结构的关键因素。

市场关注点转向:AI需求增长能否抵消架构效率提升

总体来看,Kimi K3的出现并没有简单指向AI硬件需求下降。对于英伟达而言,真正的竞争焦点可能已经从“单卡性能”转向了“系统级能力”——包括高速互联、机架级扩展以及大规模推理优化。

随着模型规模持续扩大,即使注意力机制不断优化,AI基础设施仍然面临参数规模、专家并行、数据交换以及推理吞吐提升带来的压力。

未来市场需要关注的核心问题,不是线性注意力是否会降低单项资源消耗,而是AI应用规模扩张带来的新增需求,能否持续超过架构效率提升带来的资源节省。

来源:https://www.odaily.news/zh-CN/post/5211982

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。