游乐游手机版
首页/AI热点日报/热点详情

英伟达Blackwell DGX SuperPOD助力万亿级生成式AI计算

类型:热点整理2026-07-23
英伟达新一代DGXSuperPOD搭载GB200超级芯片,专为万亿参数生成式人工智能设计。采用液冷机架级扩展技术,FP4精度下提供11 5百亿亿次浮点运算性能和240太字节显存,通过NVLink连接576块图形处理器,可扩展至数万芯片,并具备智能预测管理功能。
# NVIDIA DGX SuperPOD 教程:万亿级生成式 AI 计算的新一代超级计算机 本教程将详细介绍 NVIDIA 最新发布的 AI 超级计算机——搭载 NVIDIA GB200 Grace Blackwell 超级芯片的 NVIDIA DGX SuperPOD。它基于先进的 NVIDIA 网络、全栈 AI 软件和存储技术,可将集群中 Grace Blackwell 超级芯片的数量扩展至数万个,通过 NVIDIA NVLink 可将多达 576 块 Blackwell GPU 连成一个整体,并由 NVIDIA 系统专家加速即时 AI 基础设施的部署。

## 一、什么是 NVIDIA DGX SuperPOD? NVIDIA 于太平洋时间 3 月 18 日发布新一代 AI 超级计算机 —— **搭载 NVIDIA GB200 Grace Blackwell 超级芯片的 NVIDIA DGX SuperPOD**。这台 AI 超级计算机专为处理万亿参数模型而设计,能够保证超大规模生成式 AI 训练和推理工作负载的持续运行。 全新 DGX SuperPOD 采用 新型高效液冷机架级扩展架构,基于 NVIDIA DGX GB200 系统构建而成,在 FP4 精度下可提供 11.5 exaflops 的 AI 超级计算性能240 TB 的快速显存,且可通过增加机架来扩展性能。 > **小提示**:exaflops 是衡量超级计算机性能的单位,1 exaflops 等于每秒 10^18 次浮点运算。11.5 exaflops 意味着它每秒可以执行 115 亿亿次运算。 ### 每个 DGX GB200 系统的核心配置 每个 DGX GB200 系统搭载 36 个 NVIDIA GB200 超级芯片,共包含: - 36 个 NVIDIA Grace CPU - 72 个 NVIDIA Blackwell GPU 这些超级芯片通过 第五代 NVIDIA NVLink 连接成一台超级计算机。与 NVIDIA H100 Tensor Core GPU 相比,GB200 超级芯片在大语言模型推理工作负载方面的性能提升了 高达 30 倍。 > **常见问题**:为什么 GB200 性能提升这么大? > 答:因为 GB200 采用了全新的 Grace Blackwell 架构,结合了高性能的 Grace CPU 和 Blackwell GPU,并通过第五代 NVLink 实现了更高的带宽和更低的延迟,从而在推理任务中大幅提升了效率。 ## 二、NVIDIA 创始人兼首席执行官的观点 > **NVIDIA 创始人兼首席执行官黄仁勋表示**:“NVIDIA DGX AI 超级计算机是推进 AI 产业变革的工厂。新一代 DGX SuperPOD 集 NVIDIA 加速计算、网络和软件方面的最新进展于一体,能够帮助每一个企业、行业和国家完善并生成自己的 AI。” ## 三、Grace Blackwell 架构的 DGX SuperPOD 构成方式 Grace Blackwell 架构的 DGX SuperPOD 由 8 个或以上的 DGX GB200 系统 构建而成,这些系统通过 NVIDIA Quantum InfiniBand 网络 连接,可扩展到数万个 GB200 超级芯片。 用户可通过 NVLink 连接 8 个 DGX GB200 系统中的 576 块 Blackwell GPU,从而获得海量共享显存空间,来赋能下一代 AI 模型。 > **常见问题**:NVLink 和 InfiniBand 有什么区别? > 答:NVLink 是 NVIDIA 专有的高速互联技术,主要用于 GPU 之间的直接通信,提供超高带宽;而 InfiniBand 是一种通用的高速网络标准,用于连接多个服务器或系统节点。在 DGX SuperPOD 中,NVLink 负责机内 GPU 互联,InfiniBand 负责机间系统互联。 ## 四、面向生成式 AI 时代的全新机架级扩展的 DGX SuperPOD 架构 采用 DGX GB200 系统构建而成的全新 DGX SuperPOD 采用了 统一的计算网络。除第五代 NVIDIA NVLink 网络外,还包括: - NVIDIA BlueField-3 DPU - 支持 NVIDIA Quantum-X800 InfiniBand 网络(与 DGX SuperPOD 同日发布) 这个架构可为计算平台中的每块 GPU 提供 高达每秒 1800 GB 的带宽。 另外,第四代 NVIDIA 可扩展分层聚合和规约协议(SHARP)技术可提供 14.4 teraflops 的网络计算能力,与上一代产品相比,新一代 DGX SuperPOD 架构的网络计算能力提高了 4 倍。 > **小提示**:SHARP 技术允许在网络中直接完成数据聚合和规约操作,减少了 GPU 之间的通信开销,从而显著提升分布式训练的效率。 ## 五、统包式架构搭配先进的软件,实现前所未有的正常运行时间 全新 DGX SuperPOD 是一台完整的数据中心级 AI 超级计算机,在与 NVIDIA 认证合作伙伴提供的高性能存储集成后,能够满足生成式 AI 工作负载的需求。每台超级计算机都在出厂前完成了搭建、布线和测试,从而大大加快了在用户数据中心的部署速度。 ### 智能预测管理功能 Grace Blackwell 架构的 DGX SuperPOD 具有智能预测管理功能,能够持续监控软硬件中的数千个数据点,通过预测并拦截导致停机和低效的根源,以节省时间、能耗和计算成本。 即使没有系统管理员在场,该软件也能: - 识别需要重点关注的领域并制定维护计划 - 灵活调整计算资源 - 通过自动保存和恢复作业来防止停机 如果软件检测到需要更换组件,该集群将激活备用容量以确保工作能够及时完成,并为任何必要的硬件更换做好安排,以免出现计划之外的停机。 > **常见问题**:智能预测管理是如何实现的? > 答:它通过集成在 NVIDIA AI Enterprise 软件中的监控袋里,持续收集 CPU、GPU、内存、网络和存储等数千个数据点的运行状态,利用机器学习模型预测可能发生的故障,并自动触发预定义的响应动作(如重新分配任务、启用备用节点等)。 ## 六、NVIDIA DGX B200 系统:推动各行各业 AI 超级计算发展 NVIDIA 还发布了一款统一用于 AI 模型训练、微调和推理的通用 AI 超级计算平台——**NVIDIA DGX B200 系统**。 采用风冷传统机架式设计的 DGX 已被全球各行各业数千家企业广泛采用,DGX B200 是 DGX 系列的第六代产品。 ### DGX B200 系统核心配置 采用 Blackwell 架构的全新 DGX B200 系统包含: - 8 个 NVIDIA B200 Tensor Core GPU - 2 个第五代英特尔至强处理器 用户还可以使用 DGX B200 系统构建 DGX SuperPOD,打造能够帮助大型开发团队运行多种不同作业的 AI 卓越中心。 ### 性能表现 DGX B200 系统凭借全新 Blackwell 架构中的 FP4 精度特性,可提供: - 高达 144 petaflops 的 AI 性能 - 1.4TB 海量的 GPU 显存 - 64TB/s 的显存带宽 这使得该系统的万亿参数模型实时推理速度比上一代产品提升了 15 倍。 ### 网络配置 DGX B200 系统包含: - 8 个 NVIDIA ConnectX-7 网卡 - 2 个 BlueField-3 DPU 每个连接的带宽高达 400 Gb/s,可通过 NVIDIA Quantum-2 InfiniBand 和 NVIDIA Spectrum-X 以太网网络平台支持更高的 AI 性能。 > **小提示**:FP4 精度是 Blackwell 架构引入的 4 位浮点精度格式,相比 FP8 或 FP16 可以大幅减少显存占用和计算量,同时通过特殊优化保持了模型精度,特别适合推理场景。 ## 七、软件和专家为扩大生产级 AI 的规模提供支持 所有 NVIDIA DGX 平台均包含用于企业级开发和部署的 NVIDIA AI Enterprise 软件。DGX 用户可以通过使用该软件平台中的预训练的 NVIDIA 基础模型、框架、工具套件和全新 NVIDIA NIM 微服务来加速他们的工作。 ### NVIDIA DGX 专家服务 NVIDIA DGX 专家与部分获得 NVIDIA DGX 平台支持认证的合作伙伴将在每个部署环节为用户提供帮助,以便其迅速实现 AI 投产。在系统投入运行后,DGX 专家还将继续协助用户优化其 AI 管线和基础设施。 > **常见问题**:NVIDIA NIM 微服务是什么? > 答:NVIDIA NIM(NVIDIA Inference Microservice)是一套针对主流 AI 模型预优化的推理微服务,用户可以直接调用这些微服务快速部署和运行大语言模型等生成式 AI 应用,无需自己进行复杂的模型优化和部署配置。 ## 八、供应情况 NVIDIA 全球合作伙伴预计将在今年晚些时候提供基于 DGX GB200 和 DGX B200 系统构建而成的 NVIDIA DGX SuperPOD。 ## 总结 无论是面向万亿参数模型的旗舰级 DGX SuperPOD(基于 GB200),还是更通用的 DGX B200 系统,NVIDIA 本次推出的新一代 AI 超级计算机都展示了惊人的性能提升——从 FP4 精度的高效计算,到液冷机架级扩展架构,再到智能预测管理软件。这些创新将帮助企业、行业和国家加速生成式 AI 的落地与迭代。如果你正在规划大规模 AI 基础设施,这台超级计算机值得重点关注。
来源:https://m.elecfans.com/article/2555121.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。