NVIDIA 发现 RL 每步只改 1% 的权重,于是做了个只传差异的检查点同步方案,1T 模型从 87 分钟降到 150 秒,跑大规模 RL 的团队可以看看。
#分布式训练
共 22 条 · 7 天 3 条 · 30 天 7 条
信息流里打上「分布式训练」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
NVIDIA 提出 NeMo-DCR,RL 训练检查点同步提速 12 到 40 倍
10月7日
NVIDIA 提出 NCCL M2N 集合通信原语,优化分布式张量重分片
做 RL 训练或大规模推理部署的可以看,DeepSeek-V3 权重同步直接从 5.78 秒砍到 2.77 秒,还是进 NCCL 的正经方案。
DeepSpeed 不只 ZeRO:PyTorchCon 将详解 AutoTP、AutoSP、AutoEP 并行方案
DeepSpeed 常被当成只做 ZeRO 显存优化,这场演讲会讲它的自动张量、序列、专家并行,还带基准数据,做大模型训练的可以看看。
9月30日
9月26日
SageMaker HyperPod 跨区域训练:计算与数据分离的架构与验证
AWS 官方教程,讲怎么用 HyperPod 加 Qumulo 把训练算力和数据分开放在两个 Region,还附了吞吐量对比数据,做大规模训练的可以参考。
9月22日
9月17日
8月25日
7月9日
Cognition RL训练跨越三大洲四数据中心 结合自有GPU与FireworksAI
Cognition分享了RL训练的新玩法:跨三大洲四数据中心混用自有GPU和FireworksAI,靠压缩权重差异同步,挺有意思。
6月19日
6月18日
6月10日
5月29日
论文12:12
FedTSV:用轨迹Shapley值实现公平联邦学习联邦学习团队终于有了一个能动态衡量客户端贡献的方法——FedTSV解决了固定权重带来的不公平和训练不稳定问题,做分布式模型训练的开发者可以直接参考实验效果。
5月28日
Hugging Face 团队让异步 RL 权重同步带宽成本降低约 100 倍
做分布式 RL 训练的团队终于可以告别昂贵的带宽和复杂的基础设施——只需 HTTPS 和一个 Bucket,就能实现跨区域的推理集群同步,建议搞 RL 的开发者直接看原文。
5月27日
论文19:46
Laguna M.1/XS.2 技术报告发布,Poolside 详解模型工厂与训练细节这份报告把大模型从数据到部署的全链路细节都摊开了,做模型训练或智能体开发的团队可以直接参考其中的 Model Factory 和 Agent RL 实践,值得细读。
5月21日
Whitepill:分布式训练可规避AI暂停条约,论文提出检测方法
这篇论文戳穿了AI暂停条约的技术漏洞——分布式训练让监管形同虚设,做AI治理、安全研究的团队值得细看,看完会对现有方案的有效性重新评估。
5月19日
RRFP:应对运行时波动的流水线并行训练新方案
大模型训练中流水线并行的空闲气泡问题一直困扰着分布式训练团队,RRFP 用就绪优先的思路直接提升 GPU 利用率,做大规模训练的工程师值得关注这个新方案。
5月18日
5月14日
5月13日
TorchTPU:在Google TPU上原生运行PyTorch
TorchTPU让PyTorch用户能够更顺畅地迁移到TPU,同时保持Eager模式体验,这对需要TPU算力的大规模AI训练场景有直接价值。