游乐游手机版
首页/AI热点日报/热点详情

三星PIM内存处理技术核心原理完整深度解析

类型:热点整理2026-07-20
三星在HotChips2023大会上展示其内存处理(PIM)技术,用于加速GPT等AI大模型,针对内存瓶颈,将计算卸载至HBM-PIM、LPDDR-PIM及CXL-PNM模块,有效解决内存墙问题,大幅减少数据搬运,显著降低功耗,大幅提升能效,已从研究阶段成功迈向商业化应用。

Hot Chips 2023上,三星重点展示了他们在内存处理技术(PIM)上的最新布局。这次亮相的议题很明确:PIM不再只是实验室里的概念,而是正在向实际部署加速迈进。整个展示几乎都围绕AI大模型展开,尤其是GPT这类Transformer架构带来的内存瓶颈问题,三星给出了自己的解题思路。

先说说传统计算中的核心矛盾。CPU或GPU算得再快,数据从内存搬运过来也要花时间、耗能源。说白了,最大的开销就是数据来回搬运的成本。三星的思路很直接——给不同种类的内存多开几条通道,但这一招也有它的天花板。

好在CXL技术正在快速成熟。它允许灵活地重新配置PCIe线路的用途,从而提供更大的内存带宽。

GPT的瓶颈到底在哪?

三星这次专门针对GPT模型做了深入分析。核心目标直指Transformer模型的三大部分:线性层、多头注意力(MHA)和前馈网络(FFN)。关键在于GPT的生成阶段——这是个存储带宽饥渴型任务,由于内存限制和顺序生成特性,即使在GPU上跑,效率也远谈不上理想。

三星把GPT的工作负载分成了两类:摘要生成这类计算密集型任务,和文本生成这类内存密集型任务。其中,GEMV(广义矩阵-向量乘法)部分可能占据总生成延迟的60%~80%。这和PIM/PNM的优化目标正好对上了。

从利用率和执行时间的角度来看,问题就更清楚了。大部分执行时间都花在了从主机CPU内存到GPU内存的数据复制上。相比计算操作,GEMV操作的利用率非常低。而且随着输出token数量增加,GEMV在推理时间中的占比只会越来越高。

PIM的解法:把计算搬到内存里

三星展示的关键方案是把部分计算管道卸载到PIM模块上。这样做可以省去数据传输到CPU或xPU的成本,直接降低功耗。具体来说,GPT生成阶段需要高容量、高带宽的内存。多头自注意力和前馈网络都可以完全卸载到PIM/PNM上,充分利用其全部带宽。结果是,推理过程中的时间和能耗都能显著减少。

具体到硬件实现,三星重点展示了他们的高带宽内存HBM-PIM。这里有个有意思的对比:AMD的MI100加速卡也采用了HBM-PIM。这次三星展示的集群由12个节点、8个翻跟斗组成,专门用来验证这种新型内存技术的实际表现。

更进一步,三星还展示了T5-MoE模型在这个集群上使用HBM-PIM的效果,包括性能和能效提升的具体数据。

当然,光有硬件还不够,PIM模块要真正发挥作用,离不开软件的配合。三星正在努力把这部分能力内置到标准编程模块中。

不止于HBM:LPDDR-PIM与CXL-PNM的探索

除了HBM-PIM,三星也在推进LPDDR-PIM。它的内部带宽为102.4GB/s,看起来不算高,但设计思路很清晰:把计算留在内存模块上,减少与CPU或xPU之间的数据搬运,从而降低功耗。三星还专门分析了LP5-PIM模块的性能和功耗表现。

如果HBM-PIM和LPDDR-PIM还不够,三星还展示了一个更大胆的想法——把计算放进CXL模块里,也就是PNM-CXL。这不仅仅是在CXL Type-3模块上挂内存,而是把计算核心也装进去。

实现方式也很直接:在CXL模块上添加计算元件,可以使用标准内存,也可以在模块上跑PIM,再加上标准的CXL控制器。最新推出的一款概念型512GB CXL-PNM卡,带宽高达1.1TB/s。

三星也展示了配套的CXL-PNM软件栈。

能耗与商业化的最后一块拼图

对大语言模型这样的大规模工作负载来说,PIM技术带来的节能和吞吐量提升是实实在在的。CXL通常使用PCIe的电线传输数据,能源成本不低。因此,避免数据搬运带来的好处非常可观。

也正因如此,三星在本次展示中多次强调减少碳排放的重要性。

可以说,三星在PIM技术上的投入已经持续多年,现在明显已经从研究阶段走到了商业化落地的前夜。CXL-PNM或许最终会成为这类计算架构中一个真正成熟的方向。接下来,就看这一技术能否在更大规模的生产环境中证明自己了。

来源:https://m.elecfans.com/article/2261614.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。