近日,英伟达(NVIDIA)于7月21日正式宣布,旗下Blackwell GB300在混合专家模型(MoE)预训练任务中创下全新世界纪录——单GPU算力高达1648 TFLOPs,即每秒1648万亿次浮点运算。

首先,我们来简要了解两个关键概念。MoE(混合专家模型)是目前大语言模型领域广泛采用的一种架构:它将一个大模型拆分为多个“专家”子网络,每次推理或训练仅激活部分专家。其优势显而易见——以更低的计算成本支撑更大的模型容量,从而显著提升效率。
模型预训练,则是指在大量无标注数据上,通过自监督学习让模型先掌握通用的语言规律、视觉特征或常识。这相当于为模型打下基础,之后再针对具体任务进行微调。
回到英伟达的新成绩。官方博文指出:
使用256块GPU预训练DeepSeek-v3 671B模型,GB300 NVL72实现了每GPU吞吐1648 TFLOPs的全新世界纪录。在相同训练任务上,GB300 NVL72用更少的GPU硬件,达到了相同的性能。
这一成绩的背后并非偶然。过去六个多月,英伟达团队模拟了超过25万种不同配置,最终为Blackwell架构摸索出38项重大优化方案,累计进行了140万小时的GPU优化测试。换言之,这是海量试错与迭代的成果。
与2025年11月的预训练测试结果(1088 TFLOPs)相比,GB300 NVL72系统的性能优化提升了50%。而相较于上一代GB200(每GPU 606 TFLOPs),GB300实现了约3倍的性能飞跃。这种差距已不再是简单的迭代,而是跨越式的进步。
