英伟达再次刷新行业纪录!7月21日,官方正式宣布其Blackwell GB300在MoE(混合专家模型)预训练任务中创下新的世界纪录——每GPU算力飙升至1648 TFLOPs(每秒万亿次浮点运算)。这一成绩在业内极为亮眼,引发了广泛关注。
先简单科普一下MoE(混合专家模型)。它本质上是一种“分而治之”的架构:将一个大模型拆分为多个小专家子网络,每次推理或训练时仅激活其中一部分。其优势十分明显——用更低的计算成本支撑更大的模型容量。如今,主流大语言模型几乎都采用这一思路来提升效率。

模型预训练,则是在海量无标注数据上,通过自监督学习让模型先掌握通用的语言规律、视觉特征或常识——相当于为模型“打好基础”。
英伟达在博文中披露了具体细节:
借助256块GPU对DeepSeek-v3 671B模型进行预训练,GB300 NVL72实现了每GPU吞吐量1648 TFLOPs的全新世界纪录。在相同训练任务中,GB300 NVL72使用了更少的GPU硬件却达到了同等性能。
取得这一成绩并非易事,背后是扎实的研发投入。英伟达表示,过去6个多月里,他们模拟了超过25万种不同配置,最终为Blackwell摸索出38项重大优化方案,累计投入了140万小时的GPU优化测试。这绝非简单调整参数就能实现。

对比来看更直观:2025年11月的预训练测试中,GB300 NVL72的得分为1088 TFLOPs,如今提升了50%。而相较于上一代GB200,每GPU 606 TFLOPs的成绩直接翻了近3倍。这一代际跃升,确实令人印象深刻。





