事件专题 ·多源确认

NVIDIA 提出 NeMo-DCR,RL 训练检查点同步提速 12 到 40 倍

NVIDIA 的论文测量了六个模型,发现每步 RL 更新后只有 0.6% 到 1.2% 的权重发生变化,而标准流程仍会复制完整检查点。对 1T 模型跨两个 AWS 区域,一次完整复制需要 87.5 分钟。NeMo-DCR 只传输变化的权重值,用 XOR 掩码或覆盖编码差异,并通过中继树在差异生成的同时流式传输。在 3% 变化率下,1T 模型的同步从 87.5 分钟降到 150 秒,在 30B 到 1T 模型上比全量传输快 12 到 40 倍。

当前结论

NVIDIA 发现 RL 每步只改 1% 的权重,于是做了个只传差异的检查点同步方案,1T 模型从 87 分钟降到 150 秒,跑大规模 RL 的团队可以看看。

5 个信源53° AI 热度最后更新 2026/10/8 16:15:02

证据链

5 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。