主要来源arXiv: DeepSeek
查看原文事件专题 ·官方一手
NVIDIA 提出 NCCL M2N 集合通信原语,优化分布式张量重分片
分布式训练与推理生成的张量布局不同,权重需要跨进程组做 M-to-N 重分片,传统 all-gather 加 broadcast 方式会产生冗余流量。论文提出 NCCL M2N,根据源和目标 mesh 与 placement 推导传输区域并生成全局通信调度,跨 NVLink 域只转发一份拷贝。在 256 张 GB200 GPU 的 NVL72 集群上,单个 FFN-MoE 层传输相比扁平直发最高提速 7.9 倍(9.8 ms 对 77.3 ms)。在 256 GPU 的 DeepSeek-V3 NeMo-RL 实验中,权重同步时间从 5.78 秒降至 2.77 秒,训练步耗时减少 12.7%。
当前结论
做 RL 训练或大规模推理部署的可以看,DeepSeek-V3 权重同步直接从 5.78 秒砍到 2.77 秒,还是进 NCCL 的正经方案。
6 个信源46° AI 热度最后更新 2026/10/5 23:27:52
证据链
6 个信源冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。