游乐游手机版
首页/科技数码/文章详情

英伟达持续优化Blackwell,GB200能效三个月翻4倍

时间:2026-07-30 11:23
英伟达持续优化Blackwell平台,GB200NVL72运行DeepSeekR1模型每兆瓦吞吐量三个月翻4倍,优化成果可跨模型复用。GB300训练性能六个月提升1 5倍,扩展效率接近理论上限。新一代Rubin平台加速部署,软件优化延长了硬件生命周期。

英伟达正通过持续优化的软件栈,为Blackwell平台注入强劲生命力——在延长其生命周期、让现有客户无需急于升级硬件的同时,也为下一代Rubin架构的大规模部署奠定了坚实基础。

Rubin备受期待之际,英伟达持续优化Blackwell,GB200能效三个月翻4倍

就在新一代Rubin平台加速落地之际,英伟达公布了一项令人瞩目的成果:仅用三个月时间,GB200 NVL72在运行DeepSeek R1 0528模型时的每兆瓦算力吞吐量(TPS/MW)便实现了4倍跃升。这一突破的背后,是四个月内完成的38项重大优化迭代、超过25万次模拟配置筛选,以及累计耗费140万GPU小时的实测验证。

与此同时,GB300“Blackwell Ultra”平台在AI训练基准测试中也刷新了纪录。在256卡规模下,GB300 NVL72对DeepSeek-V3 671B模型进行预训练时,达到了每GPU 1648 TFLOPs的吞吐量——这不仅是全球最高水平,相比GB200的606 TFLOPs提升了约3倍。更值得关注的是,这一数字在过去六个月里已累计增长1.5倍。

GB200能效大幅跃升,优化覆盖90%以上模型

具体来看,针对GB200 NVL72平台,英伟达表示,经过系列优化,其在运行DeepSeek R1 0528(1K输入/1K输出配置)时,每兆瓦算力吞吐量在三个月内实现了4倍增长。

支撑这一性能飞跃的,是四个月内完成的38项重大优化迭代。这些优化经过了超过25万次模拟配置筛选,并累计投入140万GPU小时进行实测验证。英伟达特别指出,其中超过90%的优化成果具有跨模型复用性,可广泛适用于其AI产品组合中的其他模型,并非仅为单一任务量身定制。

这意味着什么?现有数据中心客户无需更换硬件,仅通过软件升级即可获得显著的能效提升。对于对算力成本高度敏感的超大规模云厂商和企业客户而言,这显然具有直接的经济价值。

GB300刷新训练纪录,六个月性能提升1.5倍

在AI训练方面,GB300 NVL72同样展现出强劲的性能势头。在256卡规模下,基于Megatron Core框架对DeepSeek-V3 671B模型进行预训练,GB300 NVL72实现了每GPU 1648 TFLOPs的吞吐量,较此前GB200的606 TFLOPs提升约3倍,并创下该任务的全球最高纪录。

更值得关注的是,这一数字并非静止的硬件极限。GB300 NVL72在Megatron Core框架下的表现,已从2025年11月的1088 TFLOPs/GPU增长至2026年6月的1648 TFLOPs/GPU,六个月内累计提升约1.5倍。

在主流AI框架的协同优化方面,英伟达与PyTorch及JAX社区的深度合作同样带来了显著增益。在TorchTitan(PyTorch原生训练栈)上,GB300 NVL72对DeepSeek-V3 671B的训练性能,相较未优化基线配置提升了6倍——从199 TFLOPs/GPU跃升至1197 TFLOPs/GPU。JAX框架下的提升幅度更为突出,截至2026年7月,每GPU吞吐量达到4082 Tokens/s,对应1025 TFLOPs/GPU,较2026年1月的418 Tokens/s提升了约10倍。

扩展效率接近理论上限,800 Gb/s网络是关键

大规模训练场景下的扩展效率,历来是衡量AI基础设施实用性的核心指标之一。英伟达披露,在256至1024卡的扩展区间内,GB300 NVL72在三大主流框架下均维持了接近理论上限的扩展效率:Megatron Core达到98.5%,TorchTitan与JAX均达到97%。

英伟达将这一扩展表现归因于NVL72机架内置的800 Gb/s Scale-Out网络芯片。高速互联直接决定了多机训练中的通信开销,进而影响整体扩展效率。可以说,这个网络能力是支撑上述跨框架高效率表现的核心基础设施组件。

Rubin平台加速落地,Blackwell优化仍在持续

上述优化进展发布之际,英伟达的下一代Vera Rubin平台已进入全球部署阶段。据报道,Vera Rubin NVL72在Token吞吐量上相较Blackwell实现了约10倍提升——GB200 NVL72约为80,000 Tokens/s,而Vera Rubin NVL72在同等150MW功耗下可达800,000 Tokens/s。

不过,Blackwell平台已经在全球无数数据中心完成了部署。英伟达的策略,其实与之前Hopper世代如出一辙:在新平台推进的同时,持续通过软件优化挖掘已部署硬件的潜力。这样做的逻辑很清晰——不仅延长了现有客户的硬件投资回报周期,也进一步强化了英伟达在AI基础设施生态中的平台黏性。对于市场而言,在Blackwell与Rubin双线并进的格局下,英伟达正在逐步构筑起一道竞争对手难以在短期内逾越的软件护城河。

来源:https://www.163.com/dy/article/L2F32SAT05198NMR.html
上一篇苹果携手Klarna推设备租赁计划,取代iPhone分期付款 下一篇万元爆改5090显卡 温度骤降11度 CPU满载才53度
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径
科技数码 · 2026-08-31

2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径

2026中国航空产业大会与南昌航空产业博览会将于10月31日至11月4日在南昌国际博览城首次同期举办。大会聚焦低空经济,设置主旨报告、行业专家报告及低空产业洽谈会等主题活动,旨在探讨航空产业新路径,推动低空物流、城市巡检等新业态集聚,打造中部领先、全国知名的航空产业交流高地。

联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南
科技数码 · 2026-08-28

联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南

联想来酷Air 16酷睿5 315版于8月27日正式开售,搭载6核处理器与12GB内存,配备16英寸16:10屏幕。叠加国家补贴后预估到手价仅3739 15元,主打长续航与静音办公。本文详细解析其硬件配置、接口布局及购买建议,助您快速决策。

牛来AirPods保护套海外走红:萌趣硅胶设计引发关注
科技数码 · 2026-08-28

牛来AirPods保护套海外走红:萌趣硅胶设计引发关注

一款名为“牛来”的AirPods硅胶保护套在日本市场引发关注,售价约1726日元。其独特的搞怪萌趣造型、兼容多代机型的硅胶材质以及专属挂饰设计,使其在社交平台上迅速走红,成为近期备受瞩目的国产原创数码周边产品。

行李箱选购全攻略:材质、轮子与尺寸避坑指南
科技数码 · 2026-08-28

行李箱选购全攻略:材质、轮子与尺寸避坑指南

选购行李箱时,材质、轮子和尺寸是核心决策点。PP材质抗冲击且轻便,适合频繁托运;万向轮决定推行顺滑度;尺寸需匹配航空限重。本文拆解关键参数,结合具体产品案例,助您选出耐用且实用的行李箱。

《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验
科技数码 · 2026-08-28

《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验

2026年8月《湮灭之潮》成都试玩会圆满举行,千名玩家现场体验西方奇幻大作。文章重点解析技嘉RTX 5080风魔显卡在虚幻5引擎下的表现,涵盖Blackwell架构、DLSS 4 5技术及16GB GDDR7显存对高画质流畅运行的支撑作用。