论文Agent 与开发者多源确认精选09:33NVIDIA 提出 NCCL M2N 集合通信原语,优化分布式张量重分片做 RL 训练或大规模推理部署的可以看,DeepSeek-V3 权重同步直接从 5.78 秒砍到 2.77 秒,还是进 NCCL 的正经方案。#NCCL#DeepSeek-V3#分布式训练#GB2005 个信源在谈事件专题aarXiv: DeepSeek@Kaushik Kandadi 等 9 人6 个信源在谈原文稍后读已读值得跟进有用关注 NCCL