游乐游手机版
首页/AI热点日报/热点详情

DeepSeek-v3 671B 英伟达GB300创MoE预训练世界纪录 单GPU达1648TFLOPs

类型:热点整理2026-07-22
近日,英伟达(NVIDIA)于7月21日正式宣布,旗下Blackwell GB300在混合专家模型(MoE)预训练任务中创下全新世界纪录——单GPU算力高达1648 TFLOPs,即每秒1648万亿次浮点运算。 首先,我们来简要了解两个关键概念。MoE(混合专家模型)是目前大语言模型领域广泛采用的一

近日,英伟达(NVIDIA)于7月21日正式宣布,旗下Blackwell GB300在混合专家模型(MoE)预训练任务中创下全新世界纪录——单GPU算力高达1648 TFLOPs,即每秒1648万亿次浮点运算。

DeepSeek-v3 671B 测试:英伟达 Blackwell GB300 刷新 MoE 预训练世界纪录,每 GPU 算力 1648 TFLOPs

首先,我们来简要了解两个关键概念。MoE(混合专家模型)是目前大语言模型领域广泛采用的一种架构:它将一个大模型拆分为多个“专家”子网络,每次推理或训练仅激活部分专家。其优势显而易见——以更低的计算成本支撑更大的模型容量,从而显著提升效率。

模型预训练,则是指在大量无标注数据上,通过自监督学习让模型先掌握通用的语言规律、视觉特征或常识。这相当于为模型打下基础,之后再针对具体任务进行微调。

回到英伟达的新成绩。官方博文指出:

使用256块GPU预训练DeepSeek-v3 671B模型,GB300 NVL72实现了每GPU吞吐1648 TFLOPs的全新世界纪录。在相同训练任务上,GB300 NVL72用更少的GPU硬件,达到了相同的性能。

这一成绩的背后并非偶然。过去六个多月,英伟达团队模拟了超过25万种不同配置,最终为Blackwell架构摸索出38项重大优化方案,累计进行了140万小时的GPU优化测试。换言之,这是海量试错与迭代的成果。

与2025年11月的预训练测试结果(1088 TFLOPs)相比,GB300 NVL72系统的性能优化提升了50%。而相较于上一代GB200(每GPU 606 TFLOPs),GB300实现了约3倍的性能飞跃。这种差距已不再是简单的迭代,而是跨越式的进步。

来源:https://www.ithome.com/0/980/018.htm

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。