游乐游手机版
首页/AI热点日报/热点详情

Arm最强处理器架构技术深度解析

类型:热点整理2026-07-20
ArmNeoverseV2核心是首款实现Armv9架构的服务器核心,整数性能提升13%,系统级缓存缺失减少10 5%,配备四个128位SVE2矢量引擎。已授权给Nvidia用于GraceCPU,AWS和Google可能采用。该核心在预取机制和矢量处理方面显著改进,适合高性能计算与AI推理。

Arm Neoverse V2 核心深度解析:从架构设计到性能提升

在近期举办的 Hot Interconnects、Hot Chips、Google Cloud Next 和 Meta Networking @ Scale 会议上,众多技术演示涌现。知名媒体 Nextplatform 经过梳理,重点关注了 Arm 公司即将重新上市的高性能计算核心——“Demeter”(即 Neoverse V2)。本教程将带你全面了解这款核心的设计理念、技术革新以及它在服务器芯片领域的定位。

一、背景:为什么 V2 核心如此重要?

Demeter(Neoverse V2)是 Arm 首款实现 Armv9 架构 的核心。在五年前,设计一款优秀的服务器核心非常困难;即便现在,设计一款完整的处理器也不容易。超大规模云服务商真正需要的是“针对工作负载定制处理器”,而非从头设计。然而,传统处理器厂商难以提供大规模定制,因为每代制造多个变体成本极高。

V2 核心是目前 Arm 为服务器设计的最佳核心,这也是 Nvidia 为何仅授权该核心,将其用于 72 核“Grace”服务器 CPU 的原因。凭借四个 128 位 SVE2 矢量引擎,V2 能够高效处理经典 HPC 工作负载、部分 AI 推理任务,甚至在某些场景下重新训练 AI 模型。

二、谁正在使用或可能使用 V2 核心?

  • Nvidia: 已明确采用 V2 核心构建 Grace 服务器 CPU。
  • AWS: 很可能在其未来的 Gra viton4 处理器中采用 V2 核心(当前 Gra viton3 使用 Zeus V1 核心)。
  • Google: 传闻正在开发定制 Arm 服务器芯片,其中可能包括与 Marvell 合作的项目,不排除使用 V2 核心。
  • AmpereComputing: 其 192 核“Siryn”AmpereOne 芯片已转向自研 A1 核心,未使用 V2。
  • C-DAC(印度): 正在基于 Neoverse V1 核心构建“Aum”处理器,用于 HPC 工作负载。
  • 富士通/RIKEN: 为“Fugaku”超算打造的 A64FX 核心(512 位向量)可视为 Neoverse V0 的前身。

值得注意的是,虽然 Arm 在 Hot Chips 2023 上推出了基于 N2 核心的 CSS 服务器芯片设计,但 并未同步推出基于 V2 核心的 CSS 设计。这或许是因为许多数据中心运营商更注重性价比优化,认为不需要过多的向量引擎。

三、V2 核心架构:性能提升的秘密

Arm 于 2020 年将 Neoverse 系列分为三条线:
V 系列:高性能核心,拥有双倍向量引擎;N 系列:专注整数性能;E 系列:专注能效和边缘计算。V2 属于 V 系列,是其高性能代表。

1. 宏观架构变更

V2 平台在 V1(Zeus)基础上进行了多项调整,整体 整数性能提升 13%(SPEC CPU 2017 整数测试),同时系统级缓存(SLC)缺失减少 10.5%。以下是改进细节:

Arm 院士 Magnus Bruce 在 Hot Chips 上介绍:V2 核心采用了 提前运行分支预测器,充当指令预取器;使用 物理寄存器文件 并在发出后读取,允许更大的发出队列;搭配低延迟私有 L2 缓存、先进预取算法和积极存储到加载转发,最大限度减少气泡和停顿。动态反馈机制还能调节核心的攻击性,防止系统拥塞。

V2 是 首个 Armv9 实现,在性能、安全性和可扩展性上相比 Armv8 有显著增强。

2. 分支预测与 L1 缓存改进

V2 核心保留了 V1 的许多功能,但将多个队列、表和带宽 增加了一倍。微操作缓存(micro-op cache)反而有所减少。这些调整使 IPC 提升约 2.9%(SPEC CPU 2017 整数基准)。

3. 解码与指令分派改进

解码器通道和队列得到提升,IPC 再增 2.9%。

4. 执行单元增强

V2 增加了两个单周期算术逻辑单元 (ALU),扩大了问题队列大小,并将谓词运算符带宽加倍。这些改进加上其他调整,在 2.8 GHz 下又带来 3.3% 性能提升。

5. 加载/存储与 TLB 优化

V2 仍有两个加载/存储管道和一个加载管道,但 TLB 条目从 40 个增加到 48 个,各种存储和读取队列也更大,性能再提升 3%。

6. 硬件预取的最大飞跃

这是 V2 性能提升最大的部分。Arm 架构师 Magnus Bruce 解释:

  • 多引擎训练: 对 L1 和 L2 缺失进行多引擎训练,预取到 L1 和 L2 缓存。
  • 虚拟地址预取: 允许页面交叉,同时充当 TLB 预取。
  • 动态反馈: 从互连获得反馈,并结合 CPU 内部准确性和及时性测量,调节预取攻击性。
  • V2 新特性: 改进了训练准确度,添加新的预取引擎,包括:
    • 全局空间内存流引擎: 覆盖更大偏移范围,显著优于旧 SMS 引擎。
    • 采样间接预取器: 处理指针解除引用场景,学习数据消耗模式。
    • 表遍历预取器: 将页表条目预取到 L2 缓存。
  • 差异化 QoS: 为需求和预取提供不同服务质量级别,确保积极预取不影响需求请求延迟。

这些改进使 SPEC 分数增加 5.3%,同时 SLC 缺失减少 8.2%,用更少的 DRAM 流量获得更高性能。

7. 二级缓存 (L2) 的影响

V2 的 L2 容量翻倍,虽然直接性能提升不大,但通过减少系统级缓存缺失间接带来好处。

8. IPC 总提升汇总

以上改进是 加法效应(非乘法),最终使 V2 核心的整数性能提升 13%,同时系统级缓存缺失减少 10.5%。

四、面积、功耗与性能平衡

V1 核心(7nm 工艺)面积为 2.5 平方毫米,1 MB L2 缓存,功耗约 1.2 瓦。V2 核心面积略小,L2 缓存翻倍(2 MB),功耗增加 17%。所有比较均以 2.8 GHz 时钟速度 标准化。

五、V2 平台规范:不仅仅是核心

V2 是可授权的平台,包括 CMN-700 互连,允许构建可扩展至 256 个内核和 512 MB 系统级缓存 的 CPU,横截面带宽可达 4 TB/秒。

六、关于矢量性能的补充

在问答环节中,Bruce 透露:V1 核心有一对 256 位 SVE1 矢量引擎,而 V2 核心有 四个 128 位 SVE2 矢量引擎。这样设计是因为将混合精度数学分散到四个单元比分散到两个单元更容易且更高效。这使得 V2 在处理 HPC 和 AI 工作负载时具备很强的矢量能力。

七、常见问题 (FAQ)

Q1:V2 核心相比 V1 到底提升了多少?
A:根据 SPEC CPU 2017 整数基准测试,V2 核心的 IPC(每时钟指令数)提升了 13%,同时系统级缓存缺失减少了 10.5%。这得益于分支预测、预取、执行单元等多方面改进。

Q2:为什么 Arm 没有推出基于 V2 的 CSS 服务器芯片?
A:虽然 Arm 推出了基于 N2 核心的 CSS 设计,但 V2 核心可能更受高端定制用户青睐。像 Nvidia 和 AWS 这样的客户可能更倾向于自行设计 SoC,因此不需要标准的 CSS 变体。此外,许多数据中心运营商认为高向量性能并非必需,更看重性价比。

Q3:V2 核心的矢量引擎有什么特点?
A:V2 核心拥有四个 128 位 SVE2 矢量引擎,相比 V1 的两个 256 位引擎,它在混合精度数学处理上更灵活高效,适合 HPC 和部分 AI 推理负载。但需要注意的是,大型语言模型(LLM)等“胖”工作负载可能仍需专用翻跟斗。

Q4:谁最有可能授权 V2 核心?
A:目前已知 Nvidia 已授权。AWS(Gra viton4 候选)、Google(传闻中的芯片)也是潜在客户。其他如 AmpereComputing 已转向自研核心,而印度 C-DAC 则基于 V1 核心开发。

小提示

  • 如果你正在考虑基于 Arm 的服务器芯片选型,V2 核心特别适合需要高向量性能的 HPC 和 AI 推理场景。对于纯整数工作负载,N2 核心可能更具性价比。
  • 注意 V2 核心的功耗比 V1 高 17%,但面积略小且 L2 缓存翻倍,整体能效比仍需根据实际部署场景评估。
  • 由于 Arm 未提供基于 V2 的 CSS 参考设计,如果你的团队没有 SoC 设计能力,选择 V2 核心意味着需要自行完成复杂的集成工作。

八、总结

Arm Neoverse V2 核心(Demeter)是服务器芯片领域的重要里程碑,它首次实现 Armv9 架构,并在整数性能、预取机制和矢量处理方面实现了飞跃。虽然目前公开的授权方只有 Nvidia,但凭借其强劲性能,预计未来将有更多超大规模云服务商和 HPC 厂商采用。对于希望自研定制处理器的企业来说,V2 核心提供了强大的基石,但需要权衡设计复杂度与性能收益。

来源:https://m.elecfans.com/article/2247507.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。