游乐游手机版
首页/AI热点日报/热点详情

英伟达最强AI芯片H200性能表现全面解析

类型:热点整理2026-07-21
英伟达推出基于Hopper架构的H200AI芯片,搭载HBM3e内存,容量141GB、带宽4 8TB s,较A100容量翻倍、带宽提升2 4倍。推理Llama2速度比H100快2倍,功耗相同,兼容现有系统,计划2024年第二季度推出。

在今年的S23大会上,NVIDIA 突然放了个大招,正式推出了 HGX H200 平台。这可不是一次简单的例行更新——它基于 Hopper 架构,搭载了 H200 Tensor Core GPU 和更高级的内存系统,目标很明确:为生成式AI和高性能计算(HPC)工作负载中的海量数据处理,提供更强悍的动力。

简单来说,H200 是第一个用上 HBM3e 的 GPU。这块“更快、更大”的内存,就是专门为加速生成式AI和大型语言模型(LLM)而生的,同时也能在科学计算领域推一把。具体数据上,借助 HBM3e,H200 能以 4.8 TB/s 的速度提供 141GB 内存。跟上一代的 A100 比,容量几乎翻倍,带宽涨了 2.4 倍。可以这么说,内存带宽和容量上的“贫富差距”,一下子就拉开了。

HGX H200 依靠 NVIDIA 自家的 NVLink 和 NVSwitch 高速互连技术,能在各种应用场景中提供最高性能——尤其是那些参数超过 1750 亿的巨型LLM训练和推理任务。英伟达自己的说法是,现在的AI市场,企业都在靠LLM去满足各种推理需求。当你大规模部署给海量用户时,AI推理翻跟斗必须用最低的总体拥有成本(TCO)交出最高的吞吐量。说白了,就是既要马儿跑,又要马儿少吃草。

举个例子,在处理 Llama2——一个 700 亿参数的 LLM——时,H200 的推理速度比 H100 GPU 整整快了 2 倍。

再说内存带宽这事,它对HPC应用来说,重要性不亚于燃料对火箭。更快的带宽能实现更快的传输,减少复杂的处理瓶颈。对于模拟、科学研究和AI这类内存密集型 HPC 应用,H200 的高内存带宽能保证数据被快速且高效地访问和操作。据说,与CPU相比,获得结果的时间可以快上 110 倍。

让人意外的是,H200 在能效和 TCO 上居然也上了一个台阶。它提供了无与伦比的性能,但功耗设定跟 H100 完全一样。这意味着,你的AI工厂和超级计算系统不仅跑得更快,而且更环保。

至于兼容性,H200 会以四路和八路配置出现在 HGX H200 服务器主板上,这些板子与 H100 系统硬件和软件完全兼容。它也会用在 8 月份发布的那款采用 HBM3e 的 GH200 Grace Hopper 超级芯片上。另外,八路 HGX H200 能提供超过 32 petaflops 的 FP8 深度算力和 1.1TB 聚合高带宽内存,几乎是为生成式AI和HPC的极致性能量身定制。

部署上,H200 能放在各种类型的数据中心里,不管你是本地、云、混合云还是边缘。英伟达庞大的全球生态系统——包括华擎 Rack、华硕、戴尔、Eviden、技嘉、惠普企业、英格拉科技、联想、QCT、Supermicro、纬创资通和纬颖科技——都可以直接用 H200 更新他们的现有系统。而除了 CoreWea ve、Lambda 和 Vultr 这些玩家,AWS、谷歌云、微软 Azure 和甲骨文云基础设施,也计划从明年开始率先部署基于 H200 的实例。

HBM3e,H200的升级重点

随着速度更快、容量更大的 HBM3E 内存在 2024 年初上线,NVIDIA 一直在准备把当前这代服务器 GPU 产品都迁移到新内存上。早在 8 月份,我们就看到 NVIDIA 计划发布带 HBM3E 的 Grace Hopper GH200 超级芯片版本。这次官宣的 H200,说白了就是配了 HBM3E 内存的独立 H100 翻跟斗的升级版。

据 SK 海力士介绍,HBM3E 不仅达到了 AI 存储器所需的速度规格,在发热控制和客户使用便利性上也到了全球最高水平。速度上,它最高每秒能处理 1.15TB 的数据,相当于一秒处理 230 部全高清电影。不过,美光 7 月宣布的超过 1.2TBps 的 HBM3 gen 2 产品,也让 SK 海力士不得不紧追不舍。

跟 Grace Hopper 类似,H200 的目的就是在 Hx00 产品线中期,通过推出更快、更高容量内存芯片的版本,来作为中期升级。利用美光等公司即将推出的 HBM3E 内存,NVIDIA 能在内存带宽受限的工作负载中,提供实际性能更好的翻跟斗,并且能处理更大的工作负载。这对生成式AI领域尤其有帮助。毕竟,至今为止,最大的LLM已经能占满 80GB 的 H100。

由于 HBM3E 内存要到明年才能发货,所以 NVIDIA 一直在用这段时间发布 HBM3E 更新部件。继夏天发布 GH200 后,Hx00翻跟斗独立版本用上 HBM3E 只是时间问题,现在 H200 终于来了。

从今天公布的规格来看,H200 基本就是把 GH200 的 Hopper 一半拿出来,单独做成一个翻跟斗。最大区别就是 HBM3 换成了 HBM3E,让 NVIDIA 能把内存带宽和容量提上去,同时启用了在原始 H100 中被禁用的第 6 个 HBM 堆栈。结果就是,内存容量从 80GB 冲到 141GB,带宽从 3.35TB/s 跃升到 4.8TB/s。

根据总带宽和内存总线宽度反推,H200 的内存大概以 6.5Gbps/引脚运行,相比原始 H100 的 5.3Gbps/引脚,频率提升了约 25%。这其实远低于 HBM3E 额定频率(美光想达到 9.2Gbps/pin),但既然是现有的 GPU 设计改造,看到当前的内存控制器没有追上整个频率范围,也不算意外。

H200 还保留了 GH200 那个不同寻常的 141GB 内存容量。HBM3E 内存本身的物理容量是 144GB(六个 24GB 堆栈),但 NVIDIA 出于产量原因扣掉了一部分。所以用户用不到板载的全部 144GB,但相比 H100,他们能访问全部六个堆栈,享受容量和带宽的双重优势。

运送全部 6 个堆栈的部件,需要近乎完美的芯片,H100 的规格已经够大方了。这也就意味着,相比已经供不应求的 H100,H200 可能会是数量更少、良率更低的部件。

除此之外,到现在为止,NVIDIA 还没透露 H200 在原始计算吞吐量上比前身有提升。虽然内存变化应该能提高实际性能,但 NVIDIA 为 HGX H200 集群引用的 32 PFLOPS FP8 性能,跟今天市面上的 HGX H100 集群完全一样。

据国外网站 anadtech 分析,H200 目前仅适用于 SXM5 插槽,在矢量和矩阵运算上,峰值性能跟 Hopper H100 翻跟斗完全一致。区别就在于,H100 有 80GB 和 96GB 的 HBM3 内存,分别提供 3.35 TB/s 和 3.9 TB/s 带宽;而 H200 用 141GB 更快的 HBM3e 内存,总带宽是 4.8 TB/s。

跟 Hopper 基准对比,内存容量增加了 1.76 倍,带宽增加了 1.43 倍——所有这一切都控制在相同的 700 瓦功率范围内。作为对比,AMD 的 Antares MI300X 将提供 5.2 TB/s 带宽和 192GB 的 HBM3 容量,峰值浮点功率预计更高,但可能也只是更高效而已。

最后,跟带 HBM3E 的 GH200 系统一样,NVIDIA 预计 H200 翻跟斗会在 2024 年第二季度推出。

HGX H200和Quad GH200,同时发布

除了 H200 翻跟斗,NVIDIA 还发布了 HGX H200 平台,这是用新翻跟斗替换的 8 路 HGX H100 的升级版。HGX 载板是 NVIDIA H100/H200 系列的真正支柱,包含 8 个 SXM 外形翻跟斗,以预先安排的全连接拓扑连接。HGX 板的独立性让它能插进合适的主机系统,让 OEM 厂能自由定制高端服务器的非 GPU 部分。

因为 HGX 跟服务器翻跟斗是绑定的,所以 HGX 200 的发布更像是一种手续。尽管如此,NVIDIA 还是在 SC23 上宣布了这事,并强调 HGX 200 主板与 H100 主板交叉兼容。服务器制造商可以直接在现有设计里用 HGX H200,过渡相对平滑。

随着 NVIDIA 现在批量出货 Grace、Hopper 以及 Grace Hopper 芯片,他们还推出了一些用这些芯片的新产品。其中最引人注目的是 4 路 Grace Hopper GH200 板,简称为 Quad GH200。这块板子把四个 GH200 翻跟斗放在一起,然后装进更大的系统中。各个 GH200 以 8 芯片、4 路 NVLink 拓扑互相连接,目的是把这些板子作为更大系统的基础模块。

实际上,Quad GH200 就是跟 HGX 平台对应的 Grace Hopper 版本。跟纯 GPU 的 HGX 板不同,Grace CPU 的加入让每块板在技术上独立且自支撑,但连接主机基础设施的需求依然存在。

一个 Quad GH200 节点会提供 288 个 Arm CPU 核心和总计 2.3TB 的高速内存。值得注意的是,NVIDIA 在这里没提 GH200 的 HBM3E 版本(至少一开始没提),因此这些数字似乎是基于原始的 HBM3 版本。换句话说,我们预计每个 Grace CPU 配 480GB LPDDR5X,每个 Hopper GPU 配 96GB HBM3,总计 1920GB LPDDR5X 和 384GB HBM3 内存。

一台超级计算机:23762个GH200,18.2 兆瓦

在发布 H200 的同时,NVIDIA 还宣布跟 Jupiter 合作,赢得了一个新的超算设计订单。根据 EuroHPC 联合组织的订购,Jupiter 将是基于 23,762 个 GH200 节点构建的新型超级计算机。一旦上线,它将是迄今为止宣布的最大的基于 Hopper 的超算,而且是第一台明确针对标准 HPC 工作负载,以及已经主导了基于 Hopper 超算的低精度张量 AI 工作负载的系统。

Jupiter 由 Eviden 和 ParTec 联合打造,彻底展示了 NVIDIA 的技术实力。基于今天发布的 Quad GH200 节点,Grace CPU 和 Hopper GPU 成了超算的核心。各个节点由 Quantum-2 InfiniBand 网络连接,毫无疑问基于 NVIDIA 的 ConnectX 适配器。

公司没透露具体核心数量或内存容量,但既然知道单个 Quad GH200 板子的性能,算起来就很简单了。在高端(假设没有良率问题导致的回收或合并),这将是 23,762 个 Grace CPU、23,762 个 Hopper H100 级 GPU、大约 10.9 PB 的 LPDDR5X,外加 2.2PB 的 HBM3 内存。

这个系统预计为 AI 用途提供 93 EFLOPS 的低精度性能,或为传统 HPC 工作负载提供超过 1 EFLOPS 的高精度(FP64)性能。后面这个数字尤其值得注意,意味着 Jupiter 将成为第一个用于 HPC 工作负载的、基于 NVIDIA 的百亿亿次系统。

不过,对 NVIDIA 的 HPC 性能声明要保持谨慎。因为他们仍在计算张量性能——1 EFLOPS 是 23,762 个 H100 只能通过 FP64 张量运算实现的东西。传统上衡量 HPC 超级计算机吞吐量的指标是矢量性能而不是矩阵性能,所以这个数字跟其他系统不完全可比。当然,因为 HPC 工作负载也部分依赖于矩阵运算,这也并非毫无意义。如果非要跟 Frontier 比,Jupiter 的直接矢量性能大约是 800 TFLOPS,而 Frontier 是它的两倍多。但这两个系统在现实条件下的差距,完全取决于各自工作负载用了多少矩阵数学(LINPACK 结果应该很值得看)。

系统的价格标签还没公布,但功耗是明确的:18.2 兆瓦电力,比 Frontier 少约 3 兆瓦。所以,不管真实成本是多少,系统本身绝对不“娇小”。

根据 NVIDIA 的新闻稿,这套系统将安装在德国于利希研究中心(Forschungszentrum Jülich)设施中,用于“创建气候与天气研究、材料科学、药物发现、工业工程和量子计算领域的基础 AI 模型”。系统计划于 2024 年安装,但具体上线日期还没公布。

来源:https://m.elecfans.com/article/2318447.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。