8月25日
03:48
03:48官方一手AWS Machine Learning Blog@Nilesh PS
精选
Amazon SageMaker HyperPod支持在Amazon EKS上管理Ray,可创建和监控Ray集群,连接JupyterLab和代码编辑器笔记本,提供开箱即用的可观察性,并从SageMaker Studio运行弹性分布式训练和加速推理,使用开源KubeRay和标准Ray API。
推荐理由:SageMaker HyperPod新增Ray支持,让分布式训练和加速推理更简单,值得一试。
7月9日
09:42
09:42Cognition@cognition_labs
精选
Cognition的强化学习训练涉及跨越三大洲的四个数据中心。他们结合自有GPU多集群和推理提供商FireworksAI的算力,只有训练器需要紧密集合通信。推理rollout采用分布式架构,引擎通过对象存储中的压缩权重差异进行同步,实现跨区域高效训练。
推荐理由:Cognition分享了RL训练的新玩法:跨三大洲四数据中心混用自有GPU和FireworksAI,靠压缩权重差异同步,挺有意思。
6月18日
09:44
09:44官方账号arXiv cs.AI@Lorenzo Sani, Zeyu Cao, Meghdad Kurmanji, Alex Iacob, Andrej Jovanovic, Yan Gao, Wanru Zhao, Nicholas D. Lane
传统分布式大模型训练需要每个数据中心持有完整模型副本,导致巨大内存和通信开销。FoMoE通过将专家层分散到不同节点,将通信开销降低至传统方法的1.42倍,相比DDP下降45.44倍。其跳词机制在实际训练中实现了1.4倍的吞吐量提升。系统建模显示,FoMoE在100B参数规模下仍能保持通信和内存优势。
推荐理由:FoMoE把MoE的专家拆开放不同数据中心,省通信还提速,适合多数据中心联合训练大模型。
6月10日
10:11
10:11官方一手arXiv: DeepSeek@Megan Frisella, Shubham Tiwari, Andy Ruan, Yi Pan, Parker Gustafson, Mat Jacob, Gilbert Bernstein, Stephanie Wang
精选
Piper 是一种用户可控的分布式训练系统,通过将训练策略与运行时实现解耦,解决了现有系统难以适应新策略或集成先进策略的问题。用户只需通过少量模型注释和调度指令声明训练策略,系统自动编译为设备执行计划。Piper 使用统一中间表示(IR)表示所有计算和通信,支持数据、流水线、专家并行及 ZeRO 等优化。实验表明,Piper 在常见策略上保持性能,同时通过联合调度计算和通信(如 DeepSeek-V3 的 DualPipe)实现额外性能与内存效率提升。
推荐理由:Piper 解决了分布式训练中策略与实现绑定的痛点,做大规模模型训练或并行策略研究的开发者可以直接用这套框架灵活组合新策略,省去手动调优的麻烦。
5月29日
5月27日
19:46
5月21日
5月13日
00:33
00:33官方一手Google Developers Blog博客/媒体
TorchTPU是Google为TPU打造的原生PyTorch运行栈,旨在最小代码改动下实现高性能分布式训练。它采用“Eager First”模式,并利用XLA编译器优化集群训练。项目计划在2026年进一步降低编译开销,支持动态形状和自定义内核,以支持下一代AI模型的扩展。
推荐理由:TorchTPU让PyTorch用户能够更顺畅地迁移到TPU,同时保持Eager模式体验,这对需要TPU算力的大规模AI训练场景有直接价值。