DeepSeek-v3 671B 测试:英伟达 Blackwell GB300 刷新 MoE 预训练世界纪录

DeepSeek-v3 671B 测试:英伟达 Blackwell GB300 刷新 MoE 预训练世界纪录,每 GPU 算力 1648 TFLOPs

精选理由

英伟达用 Blackwell GB300 跑 DeepSeek-v3,每 GPU 1648 TFLOPs,比上一代快 3 倍,技术优化真猛。

AI 摘要

英伟达宣布其 Blackwell GB300 在 256 块 GPU 上预训练 DeepSeek-v3 671B 模型,每 GPU 算力达到 1648 TFLOPs,刷新 MoE 预训练世界纪录。相比 2025 年 11 月的 1088 TFLOPs,性能优化提升 50%。与上一代 GB200 的 606 TFLOPs 相比,GB300 实现了约 3 倍性能跃升。英伟达通过模拟超过 25 万种配置,发现 38 项优化方案,累计进行 140 万小时 GPU 优化测试。

原文 · IT之家

DeepSeek-v3 671B 测试:英伟达 Blackwell GB300 刷新 MoE 预训练世界纪录,每 GPU 算力 1648 TFLOPs

IT之家 7 月 22 日消息,英伟达昨日(7 月 21 日)发布博文,宣布其 Blackwell GB300 刷新 MoE 预训练的世界纪录, 每 GPU 算力达 1648 TFLOPs(每秒万亿次浮点运算)。 IT之家注:MoE(混合专家模型)是一种机器学习模型架构。它将大型模型分割为多个更小的“专家”子网络,每次推理或训练时仅激活其中一部分。该架构旨在以更低的计算成本实现更大规模的模型容量,常用于大语言模型以提升效率。 模型预训练是指在大规模无标注数据集上,利用自监督学习方法让模型初步掌握通用的语言规律、视觉特征或常识。 在最新博文中,英伟达表示: 使用 256 块 GPU 预训练 DeepSeek-v3 671B 模型,GB300 NVL72 实现了每 GPU 吞吐 1648 TFLOPs 的全新世界纪录。在相同训练任务上,GB300 NVL72 用更少的 GPU 硬件,达到了相同的性能。 英伟达表示在过去 6 个多月时间里,通过模拟超过 25 万种不同配置,为 Blackwell 摸索发现了 38 项重大优化方案,累计进行了 140 万小时的 GPU 优化测试。 相比较 2025 年 11 月的预训练测试(1088 TFLOPs)结果,GB300 NVL72 系统性能优化提升 50%。 与上一代 GB200 每 GPU 606 TFLOPs 的成绩相比,GB300 实现了约 3 倍的性能跃升。