游乐游手机版
首页/电脑教程/文章详情

英伟达Rubin GPU详细架构曝光,性能提升10倍

时间:2026-07-23 19:38
英伟达发布RubinGPU架构,采用台积电3nm制程,集成3360亿晶体管、288GBHBM4,带宽22TB s,较Blackwell提升2 8倍。VeraRubinNVL72搭配VeraCPU,智能体推理吞吐量提升10倍,并针对MoE模型、长上下文注意力及能效进行优化。

7月23日,英伟达(NVIDIA)正式公布了Rubin GPU架构的详细技术规格。作为新一代Vera Rubin平台的核心计算单元,这款芯片的亮点颇多。

数据显示,在同等功耗下,Vera Rubin NVL72搭配Vera CPU,在Agentic AI推理吞吐量方面,相比Blackwell NVL72搭配x86 CPU,最高可提升10倍。这一性能提升幅度令人瞩目。

英伟达Rubin GPU详细架构首曝:性能10倍提升!Vera Rubin平台相比Blackwell在智能体推理性能上实现10倍提升

完整的Vera Rubin NVL72机架由36个Vera CPU和72个Rubin GPU组成。关于Vera CPU此前已有介绍,本文将重点聚焦Rubin GPU。

英伟达Rubin GPU详细架构首曝:性能10倍提升!

先看基础规格。Rubin GPU采用台积电3nm N3P工艺,由两颗计算芯粒通过NVIDIA高速片间互联接口NV-HBI统一封装。整颗芯片集成3360亿个晶体管,包含224个SM流处理器和896个Tensor Core张量核心,搭载第三代Transformer引擎,可提供最高50 PF的NVFP4推理性能。

英伟达Rubin GPU详细架构首曝:性能10倍提升!Rubin GPU芯片架构框图

显存方面,Rubin集成了最高288GB HBM4,配置8组12-Hi堆叠,峰值带宽达到22TB/s,相比Blackwell和Blackwell Ultra提升了2.8倍。这一带宽提升对于大模型推理具有重大意义。

英伟达Rubin GPU详细架构首曝:性能10倍提升!Rubin内存带宽相比Blackwell提升2.8倍

互联方面,第六代NVLink提供3600GB/s扩展带宽,用于GPU之间全互联通信;NVLink-C2C提供1800GB/s,用于CPU-GPU一致性通信;PCIe Gen6 x16则提供256GB/s的主机连接带宽。

针对当前主流的MoE(混合专家)模型,Rubin在扩展瓶颈上进行了针对性优化。它增强了Tensor Memory Accelerator(TMA),通过优化描述符管理机制,能够更高效地定位和调度专家权重,减少数据搬运开销。多个内核还可以为共享相同布局的张量保留统一描述符,在运行时直接通过TMA指令覆盖内存指针和步长等字段,进一步减少元数据管理和数据搬运开销,从而让更多GPU时间用于实际推理计算。

英伟达Rubin GPU详细架构首曝:性能10倍提升!Rubin简化MoE描述符管理机制(右侧为Rubin架构)

另一核心升级是Tensor Core,每时钟周期的K维度吞吐量翻倍。这意味着更少的循环迭代次数——Blackwell需要4次K迭代的GEMM运算,而Rubin只需2次即可完成,循环开销显著降低,Tensor Core利用率也更高。

英伟达Rubin GPU详细架构首曝:性能10倍提升!左图为Blackwell,右图为Rubin

长上下文注意力加速是Rubin的又一亮点。它将激活稀疏化与自适应压缩相结合,将中间数据加载为2:4稀疏格式,仅保存非零数据及对应元数据。后续的softmax和第二注意力GEMM都可以基于非零值运算,同时保持最终输出仍为标准Dense格式。这样一来,在不改变模型接口的前提下,计算量和数据搬运都得到了减少。

此外,Rubin还提升了Softmax及指数运算性能。FP32吞吐达到GB300水平,是GB200的2倍;BF16/FP16吞吐相比GB200提升4倍,相比GB300提升2倍。

英伟达Rubin GPU详细架构首曝:性能10倍提升!Rubin自适应压缩稀疏化技术

在内核间依赖调度方面,Rubin实现了比Blackwell更精细的协调。Blackwell启动时,Kernel可以更早开始工作,但仍需等待激活数据可用。而Rubin支持瓦片级触发,允许后续Kernel在所需输入数据准备完成后立即提前启动,不必等待更大范围的工作完成,从而有效压缩GPU时间线中的空闲间隙。

英伟达Rubin GPU详细架构首曝:性能10倍提升!上方为Blackwell批量触发,下方为Rubin瓦片级触发

GPU间通信方面,Rubin引入了计数写入(Counted Writes)机制,用于设备发起的NVLink通信。传统GPU间数据传输需要额外的协调和同步步骤,而计数写入则让接收端GPU能更高效地跟踪传输完成状态,减少同步延迟,使计算不必等待同步操作。

英伟达Rubin GPU详细架构首曝:性能10倍提升!通过计数写入加速NVLink通信(左为Blackwell,右为Rubin)

最后,来看看机架级能效管理。Vera Rubin NVL72将计算、网络、液冷、功率调节和智能功率平滑整合为单一执行域。系统通过集成储能模块,可吸收GPU瞬时功率波动,平均功耗降低约10%,50毫秒峰值功耗降低约20%。

英伟达Rubin GPU详细架构首曝:性能10倍提升!

英伟达还推出了DSX OS操作系统,其中集成了DSX MaxLPS,可统一管理GPU、机柜、液冷系统以及AI工作负载。一个关键点在于,它能在相同功率预算下,多部署最多40%的GPU。

英伟达Rubin GPU详细架构首曝:性能10倍提升!

来源:https://m.mydrivers.com/newsview/1138473.html
上一篇OBS Studio 32.2 发布:新增“添加源”对话框功能 下一篇攻击鲨RS6 ULTRA鼠标配PAW3955传感器及磁吸换电系统
本站内容用于信息整理与展示,如有侵权或内容问题请及时联系处理。

相关推荐

补充同频道和同主题内容,方便继续浏览更多相关内容。

同类最新

继续查看同栏目最近更新的文章。

更多
Win7英文版改中文版的语言包安装与切换方法
电脑教程 · 2026-07-25

Win7英文版改中文版的语言包安装与切换方法

通过安装简体中文语言包并切换显示语言,可将Win7英文版界面转为中文,无需重装系统。操作包括下载对应版本语言包、安装运行,在控制面板中更改显示语言后注销即可生效。

Win7安全模式卡在disk.sys无法进入的解决方法
电脑教程 · 2026-07-25

Win7安全模式卡在disk.sys无法进入的解决方法

Win7安全模式卡在disk sys,常因内存条不兼容或分区非MBR导致。可通过命令提示符运行diskpart转换MBR,或用DiskGenius重新分区转换格式解决。

TCL科技斥资93.25亿元完成广州华星半导体全资收购
电脑教程 · 2026-07-25

TCL科技斥资93.25亿元完成广州华星半导体全资收购

聊聊TCL科技近期的重要战略布局。2025年7月25日,深交所正式通过了TCL科技收购广州华星半导体45%股权的审核。这笔交易总金额高达93 25亿元,其中现金与股份支付各占一半,约46 62亿元。收购完成后,TCL科技将直接及间接持有广州华星半导体100%的股权。当然,最终还需取得证监会同意注册的

雷鸟34U8A带鱼屏显示器 1440P 200Hz 3099元
电脑教程 · 2026-07-25

雷鸟34U8A带鱼屏显示器 1440P 200Hz 3099元

7月25日,雷鸟正式推出了新款34英寸带鱼屏显示器,型号为“34U8A”,可视为Q8的迭代升级版本。官方定价3099元,享受补贴后到手价仅2789元,将于7月31日开售。对于正在寻找高规格超宽屏显示器的用户而言,这款产品无疑是一个值得关注的新选择。 该显示器采用了一块34英寸、1500R曲率的WQH

联想拯救者27-1r显示器开售:原生280Hz IPS屏仅789元
电脑教程 · 2026-07-25

联想拯救者27-1r显示器开售:原生280Hz IPS屏仅789元

显示器市场又添新丁——联想刚刚上架了新款拯救者电竞显示器 LEGION 27-1r,价格定在 789 元。 从产品页面来看,这台显示器最大的亮点,无疑是那块原生 280Hz 的高刷新率面板。你想想,在竞技游戏里,每一帧的抢先都可能是胜负手。原生 280Hz 意味着什么?意味着画面反馈更实时,动态画面