Agentic AI的兴起,正在把更多关键的执行路径转移到CPU上。这些AI智能体在沙盒环境中运行,执行代码、调用工具、检索上下文、与数据库交互,并在将结果返回给模型之前进行分析。随着这些循环在AI工厂中并发运行,CPU的性能越来越成为决定单个智能体响应速度和整体工厂吞吐量的关键因素。
这意味着,对CPU的设计思路,需要重新审视。智能体工作负载对CPU提出了几项特别的要求:
- 即使在插槽满载的情况下,也需要强大的单线程性能。
- 每个核心需要足够的内存带宽,以确保多个活跃的执行上下文都能得到数据的及时供给。
- 在高并发下,延迟必须是可预测的,这样才能保证智能体的每一步都能稳定完成。
- 需要高效处理不规则的流程控制、很长的依赖链,以及以指针操作为主的数据结构。
这些要求,与传统的云计算CPU设计理念形成了鲜明对比。传统CPU往往更看重核心密度和在处理更均匀的工作负载时的吞吐量。而Agentic AI则更看重在每个智能体循环中,那些顺序执行、分支密集且对延迟敏感的软件路径上,能保持持续的单线程进度。
NVIDIA的Vera CPU正是为这类工作负载而设计的,其核心就是Olympus核心。本文接下来将深入探讨Olympus核心的架构、多线程设计、一致性结构、内存子系统,以及支持其在AI工厂规模下实现高单线程性能的安全扩展连接。更深入的技术讨论,可以参考随附的NVIDIA Vera CPU白皮书。
为最大单线程智能体性能而设计的核心
说起来,Olympus核心的诞生,并非空中楼阁。它是在Vera Rubin平台下,经过CPU、GPU、网络、存储、内存系统以及软件层之间极致协同设计的结果。这种系统级的视角,让NVIDIA得以从AI工厂的整体出发进行优化,而不仅仅是孤立地考虑CPU本身。随着Agentic AI和强化学习对CPU端执行的压力越来越大,Olympus的设计目标就是加速那些不规则的、分支密集的、对延迟敏感的软件路径——这些路径正日益成为决定端到端性能的关键因素。
Olympus核心是NVIDIA Vera CPU的计算引擎,它从零开始设计,目标就是最大化高度并发AI基础设施工作负载的每周期指令数(IPC)。它融合了高单线程性能、宽指令吞吐量、深度乱序执行以及先进的内存加速技术,旨在高效执行Agentic AI、强化学习、数据分析以及大规模软件工作负载。
如图1所示,Olympus核心由以下几个模块组成:
- 前端: 优化的分支预测器
- 中核: 关键路径加速
- 执行引擎: 复杂向量优化
- 缓存子系统: 延迟优化的指令与数据路径
前端:为“分支密集型”工作流而生
Olympus的前端设计,是为了确保核心在处理大型、分支密集的软件栈时,能持续获得有用的指令。像智能体运行时、解释器、编译器、图分析引擎、数据处理框架这类工作负载,往往伴随着巨大的指令体积和频繁的控制流变化,这很容易让执行资源处于闲置状态。Olympus通过先进的分支预测、高带宽的指令获取,以及一个10宽度的解码引擎,每个周期为核心输送更多指令,从而应对这些挑战。
这套方案的核心是Olympus的分支预测子系统。它包含了一个神经分支预测器,专门用来提高对那些难以预测的、有统计偏差的分支模式的准确率。通过减少执行错误路径,并支持每个周期最多处理两个分支,它确保了在软件行为不规则时,控制流的吞吐量仍然能保持稳定。结合宽解码路径,这些能力使得Olympus在应对延迟敏感的工作负载——尤其是Agentic AI和强化学习应用中那些复杂的控制流处理时,能保持强大的前端吞吐量。
中核:挖掘“依赖链”中的隐藏并行性
智能体工作负载常常遵循着一条长长的依赖链:解释代码、遍历对象、管理运行时状态、处理工具输出、在类似图的数据结构中导航。在这些路径中,性能不仅取决于指令的获取,更取决于核心是否能在早期指令由于分支、内存或依赖解析而等待时,发现并利用其中的独立工作。
Olympus的中核正是为了暴露和加速这种隐藏的并行性而设计的。一个宽大的重命名和分配引擎将解码后的指令映射到物理资源,同时,一个巨大的重排序缓冲区和大量的物理寄存器容量,让更多的指令可以进入飞行状态,从而实现更深的乱序执行。依赖破解技术——包括内存重命名、值预测和关键路径加速——有助于减少由指针密集型代码、序列化内存操作和长依赖链引起的停顿。
这些特性共同作用,让执行引擎保持高效,提升IPC,并强化了在智能体、强化学习环境以及现代AI基础设施中常见的、那些不规则软件路径上的单线程性能。
执行引擎:不仅仅是“高频率”
智能体工作负载需要的不仅仅是宽大的前端。一旦指令进入核心,CPU必须高效地处理不断变化的整数运算、分支、向量工作和内存访问,而不能制造新的瓶颈。传统x86服务器CPU的惯用做法是“提频”,以此提高单线程响应速度。但智能体工作负载的瓶颈往往在于不规则的流程控制、长依赖链和内存延迟,这些挑战需要的不是单纯的频率,而是更高的IPC。
Olympus的执行引擎将宽大的指令供给转化为有效的执行。它动态调度操作,跨越一套广泛的整数、分支、向量、浮点、加密、加载和存储资源,这一切都得益于宽大的后端和深度的乱序执行。这种均衡的设计,让Olympus能高效处理分支密集型软件、向量化数据处理、AI预处理、加密、压缩、分析以及其他内存密集型工作负载。
缓存子系统:应对“不规则”数据访问
智能体经常操作那些无法整齐地放进缓存的数据结构,比如运行时对象、检索索引、工具状态、图结构、稀疏数据、数据库以及环境内存。传统的缓存和预取设计对于规则的流式访问模式效果很好,但当地址依赖于前一次内存查找的结果时——这在指针密集型和图相似的智能体工作流中很常见——它们就力不从心了。
Olympus的缓存子系统正是为了减少这类停顿,并确保执行引擎能持续获得指令和数据。它结合了深度缓存层次结构、内存消歧技术和多个硬件预取引擎。特别值得一提的是,Olympus还包含了一个图预取器,专门用于提升数据密集型图和分析工作负载的性能。
这些能力结合起来,降低了有效内存延迟,增加了内存级并行性,帮助智能体、图分析和数据处理工作负载在等待不规则内存访问上花费更少时间,从而将更多时间用于有用的计算。
为工具调用和强化学习而生的多线程创新
多线程对智能体工作负载至关重要,因为这类工作负载往往是突发性的、事件驱动的,并且与后台系统活动相互交织。一个典型的沙盒可能运行一个主要的执行路径,同时处理异步I/O、定时器、运行时服务、网络、日志、内存管理和工具编排。第二个硬件线程让CPU能够在本地吸收这些辅助工作,从而提高利用率和响应速度,同时减少主智能体线程频繁让步、迁移或等待的次数。
传统的同步多线程(SMT)通过让两个硬件线程共享一个核心来提高利用率,但这种共享也会引入争用。在线程密集的沙盒环境中,线程可能会在分支预测、解码带宽、执行资源、加载/存储容量、缓存和内存带宽上发生竞争。这就在核心内部产生了“吵闹邻居”效应,一个线程的活动可能会降低另一个线程的性能。对于Agentic AI、强化学习环境和云服务来说,这种不确定性是致命的,因为尾部延迟会直接影响吞吐量和服务质量。
Vera CPU采用了不同的思路,即NVIDIA空间多线程技术(SMT)。它并非单纯依赖机会主义的资源共享,而是设计宽大的Olympus核心,以便在两个硬件线程之间更有效地划分资源。这使得Olympus在需要最大单线程性能时,可以作为一个高吞吐量的单线程核心运行,由兄弟线程来处理管理活动;而在需要更高线程密度时,则可以切换成两个更独立的执行上下文。
最终的结果是:强大的单线程性能、更高的利用率,以及负载下更可预测的行为。通过88个Olympus核心和176个SMT线程,Vera CPU能够支持大量并发的智能体任务,同时减少线程间的干扰,提供更一致的延迟和吞吐量。
利用一致性结构和高带宽内存,维持Agentic AI性能
一个高IPC的核心,只有在处理器的其余部分能够持续为其提供数据时,才能发挥其全部价值。Agentic AI、强化学习、图分析和数据处理工作负载通常依赖于大型工作集和不规则的访问模式,这使得结构带宽、缓存访问、内存带宽和延迟与执行宽度同等重要。
Vera CPU将Olympus核心与NVIDIA可扩展一致性结构(SCF)和SOCAMM2 LPDDR5X内存配对,为AI工厂规模下的高吞吐量CPU执行创建了一个更均衡的平台。
NVIDIA可扩展一致性结构
NVIDIA可扩展一致性结构是Vera CPU的通信骨干,它通过一个一致性、高带宽的片上结构,将Olympus核心、共享缓存、内存控制器、I/O和NVLink-C2C接口连接在一起。它提供高达3.4 TB/s的二分带宽,并在所有核心间集成了一个164 MB的统一L3缓存。通过将缓存和结构资源放在一个单片计算芯片上,Vera CPU避免了碎片化小芯片设计中常见的跨芯片延迟和可变性,从而支持在整个处理器上更可预测地访问共享数据。
这一点对智能体工作负载尤其有价值,因为它们经常交换状态、遍历共享数据结构,并在运行时、检索、分析和编排代码之间切换。SCF有助于减少争用、改善缓存共享,并维护CPU资源间的一致性访问,同时作为与GPU和扩展平台进行NVLink-C2C连接的集成点。
SOCAMM2 LPDDR5X内存
Vera CPU使用SOCAMM2 LPDDR5X内存,为AI基础设施提供所需的带宽、效率和容量。该内存子系统提供高达1.2 TB/s的总带宽,即每个核心高达14 GB/s,帮助每个Olympus核心在高并发下保持有效工作。与基于传统DDR5和MRDIMM的服务器设计相比,SOCAMM2 LPDDR5X在提供相同带宽的同时,内存功耗显著降低,从而在应对带宽密集型AI、分析、图计算和强化学习工作负载时,降低了平台功耗,同时确保核心数据供给。
SOCAMM2还为企业级LPDDR内存带来了可维护性。它没有采用焊接在板上的LPDDR,而是使用了模块化、可现场更换的内存模块,这些模块保留了高速LPDDR5X所需的短电气路径,同时支持数据中心的部署模式。最终形成的内存架构,兼具高带宽、高能效和强大的可靠性、可用性、可服务性(RAS)能力,这是将CPU性能扩展到AI工厂规模的关键。
更快、更安全、更大规模地移动Agentic AI数据
一个高性能CPU不仅仅要能快速执行指令。它还必须能在AI工厂中安全高效地移动数据。现代AI系统依赖CPU来协调翻跟斗、内存、存储、网络和其他处理器,这使得扩展连接和I/O带宽成为系统整体性能的核心。
Vera CPU将一致性NVIDIA NVLink-C2C、双路扩展、PCIe 6.4、CXL 3.1和机密计算整合到一个均衡的平台架构中。这些能力支持在下一代AI基础设施中实现安全、高带宽的数据移动。
双路扩展
Vera CPU可以从单路部署扩展到一致性双路平台,这得益于第二代NVLink-C2C提供的高带宽插槽间连接。这使得两个CPU可以作为统一系统运行,实现一致性数据共享和可预测的扩展性能,同时为AI工厂、HPC和企业计算中的大型CPU工作负载,保持了更简单的软件模型。
传统的x86服务器CPU经常使用小芯片设计,这可能在每个插槽内暴露多个NUMA域。在大型双路系统中,这会造成碎片化的内存拓扑,迫使软件小心翼翼地放置线程、内存和I/O流量,以避免远程访问、额外的芯片跳转和不均匀的延迟。
Vera CPU采取了软件优先的方法。每个插槽呈现为一个单一的NUMA域,在双路系统中形成一个简洁的两NUMA节点拓扑。它基于单芯片计算芯片、统一的系统级缓存和一致性结构,减少了由拓扑引起的可变性,避免了跨越多芯片的开销。最终的结果是,一个更容易编程和调优的双路平台,为Agentic AI、强化学习、分析和企业工作负载提供了更可预测的扩展性。
I/O连接性
它包含PCIe 6.4,用于提供高带宽、灵活的连接,以支持下一代网络、存储、翻跟斗和外围设备。一个双路配置可提供176条PCIe通道,支持广泛的平台设计。Vera CPU还支持CXL 3.1,可以实现一致性内存扩展、内存池化和可组合基础设施,满足那些需要更大内存足迹的工作负载。
机密计算
Vera Rubin NVL72将机密计算扩展到了扩展AI基础设施,保护了在CPU、一致性GPU和互连上使用中的数据,而无需进行不必要的数据复制或使用反弹缓冲区。它基于Arm CCA/RME,具有每VM加密密钥,Vera CPU提供机密VM隔离,支持安全分配支持TDISP的一致性设备,并使用经过认证的C2C加密来保护一致性链路上的数据。这些能力共同建立了一个统一的信任域,为从服务器到机架规模的AI工作负载提供了安全保障。
提供领先的智能体工作负载性能
在介绍了Olympus核心、结构、SOCAMM2 LPDDR5X内存和双路扩展架构之后,下一个自然的问题就是:这些设计选择如何转化为智能体工作负载的性能?智能体系统将大量CPU时间花在Python执行、代码编译、静态分析和工具驱动的软件工作流上。这些软件路径对大型指令体积、分支密集型控制流、动态运行时行为以及长依赖链提出了很高的要求。
一个关键的衡量指标是,在插槽满载情况下的单线程性能。Agentic AI和强化学习通常同时运行大量的沙盒、工具和环境。每个智能体的步骤都依赖于强大的单线程进度,但这一进度必须在整个CPU共享插槽级功耗、缓存、内存带宽和结构资源时仍然能够保持。因此,负载下的单线程性能,更能代表AI工厂规模下智能体的吞吐量、响应速度和CPU端效率。
想了解更多关于NVIDIA Vera CPU架构和性能的信息,请参考NVIDIA Vera CPU白皮书。
SPEC CPU® 2026结果是在2026年7月内部测量的。关于性能测量和配置的详细信息,请参考NVIDIA Vera CPU白皮书。
SPEC®、SPEC CPU®和SPECrate®是标准性能评估公司(www.spec.org)的注册商标。
