09:50arXiv cs.LG@María Gragera Garcés, Lirandë Pira精选该论文提出量子环全归约(quantum ring all-reduce),利用预共享纠缠和超密编码,将逐链路在线通信量降低至最优因子2倍。协议通过验证纠缠实现可组合的ε安全聚合,仅需2倍GHZ副本开销,提供经典协议无法实现的信息论隐私。在梯度冲突检测中,对于GapIP_τ问题,量子优势在边际参数上呈二次方改进:需Õ(τ⁻¹ log P)量子比特 vs Õ(min(τ⁻², P))经典比特。对于TieAudit_ε问题,量子优势呈指数级分离:仅需O(ε⁻² log P)量子比特,而经典需Ω(√P)比特。论文ring all-reduce量子通信分布式训练隐私聚合梯度冲突检测推荐理由:这篇论文讲怎么用量子通信让分布式训练既省带宽又有信息论隐私保护,比经典协议通信量减半,梯度检测上还有指数级优势。原文
09:44arXiv cs.AI@Lorenzo Sani, Zeyu Cao, Meghdad Kurmanji, Alex Iacob, Andrej Jovanovic, Yan Gao, Wanru Zhao, Nicholas D. Lane传统分布式大模型训练需要每个数据中心持有完整模型副本,导致巨大内存和通信开销。FoMoE通过将专家层分散到不同节点,将通信开销降低至传统方法的1.42倍,相比DDP下降45.44倍。其跳词机制在实际训练中实现了1.4倍的吞吐量提升。系统建模显示,FoMoE在100B参数规模下仍能保持通信和内存优势。论文FoMoEMoE分布式训练通信优化弱连接数据中心推荐理由:FoMoE把MoE的专家拆开放不同数据中心,省通信还提速,适合多数据中心联合训练大模型。原文
10:11arXiv: DeepSeek@Megan Frisella, Shubham Tiwari, Andy Ruan, Yi Pan, Parker Gustafson, Mat Jacob, Gilbert Bernstein, Stephanie Wang精选Piper 是一种用户可控的分布式训练系统,通过将训练策略与运行时实现解耦,解决了现有系统难以适应新策略或集成先进策略的问题。用户只需通过少量模型注释和调度指令声明训练策略,系统自动编译为设备执行计划。Piper 使用统一中间表示(IR)表示所有计算和通信,支持数据、流水线、专家并行及 ZeRO 等优化。实验表明,Piper 在常见策略上保持性能,同时通过联合调度计算和通信(如 DeepSeek-V3 的 DualPipe)实现额外性能与内存效率提升。论文分布式训练并行策略中间表示ZeRODeepSeek-V3推荐理由:Piper 解决了分布式训练中策略与实现绑定的痛点,做大规模模型训练或并行策略研究的开发者可以直接用这套框架灵活组合新策略,省去手动调优的麻烦。原文
12:12arXiv cs.LG@Daniel Kuznetsov, Ziqi Wang联邦学习面临客户端贡献不均和动态变化的问题,传统固定权重聚合方法导致学习偏差和不稳定。本文提出轨迹Shapley值(TSV),一种基于验证集和时序一致性的贡献度量,能评估每个客户端对全局模型优化轨迹的影响。基于TSV,作者设计了FedTSV自适应聚合方法,将每轮评估转化为动态客户端权重,实时应对异构和对抗性参与。在基准数据集上的实验表明,FedTSV加速收敛、提升鲁棒性,并实现更公平的贡献评估,为公平感知联邦优化提供了理论基础。论文联邦学习公平性Shapley值自适应聚合分布式训练推荐理由:联邦学习团队终于有了一个能动态衡量客户端贡献的方法——FedTSV解决了固定权重带来的不公平和训练不稳定问题,做分布式模型训练的开发者可以直接参考实验效果。原文
11:42Ate-a-Pi@svpino72°一位技术博主分享了一种新颖的视频生成模型训练方法,团队没有使用大型互联GPU集群,而是用多个小型、独立的GPU集群分别训练不同的“专家”模型。这些专家模型在训练时无需通信,训练完成后通过一个智能路由器在推理时动态组合,协同工作。这种方法降低了硬件门槛,且效果出色。论文链接已附,值得技术爱好者深入阅读。技巧视频生成分布式训练专家模型推理路由论文推荐理由:这种分布式训练思路颠覆了传统大模型训练范式,做模型训练或视频生成的开发者可以看看论文,或许能启发新的低成本训练方案。原文
22:05Clement Delangue@ClementDelangue精选83°Hugging Face 科学团队在 TRL 库中实现了一种新的异步强化学习权重同步方法,将每次同步的带宽成本降低约 100 倍。核心洞察是:在 RL 步骤之间,约 99% 的 bf16 权重是比特相同的,只有极少部分发生变化。他们只将变化的元素编码为稀疏 safetensors 文件,通过 Hugging Face Bucket 传输,而不是传输整个权重文件。以 Qwen3-0.6B 为例,每次步骤的传输量从 1.2 GB 降至 20-35 MB。这意味着不再需要共享集群、RDMA、VPN 或跨云 NCCL,只需一个 GPU 和一个 Hugging Face 账号即可进行真正的分离式 RL 训练。AI产品强化学习权重同步Hugging FaceTRL分布式训练推荐理由:做分布式 RL 训练的团队终于可以告别昂贵的带宽和复杂的基础设施——只需 HTTPS 和一个 Bucket,就能实现跨区域的推理集群同步,建议搞 RL 的开发者直接看原文。原文
19:46Latent.Space@latentspacepodPoolside 发布了 Laguna M.1 和 Laguna XS.2 的技术报告,详细介绍了模型工厂、预训练数据、分布式训练、后训练、智能体强化学习、量化和评估等关键环节。该报告在 Latent Space 论文俱乐部活动中由 @vibhuuuus 进行解读。这是对开源大模型训练流程的一次深度公开,为研究者和开发者提供了宝贵的实践参考。论文技术报告模型工厂分布式训练智能体强化学习Poolside推荐理由:这份报告把大模型从数据到部署的全链路细节都摊开了,做模型训练或智能体开发的团队可以直接参考其中的 Model Factory 和 Agent RL 实践,值得细读。原文
07:58Marc Andreessen@pmarca精选72°Marc Andreessen转发了一篇关于AI暂停条约漏洞的论文。该论文指出,通过分布式训练,可以在低于所有计算治理阈值的硬件上,利用消费级互联网训练出GPT-4规模的模型,成本低于1亿美元。论文提出了一种检测并阻止此类违规训练的方法。这揭示了现有AI治理框架的重大缺陷,对AI安全监管具有重要警示意义。论文AI安全分布式训练计算治理AI暂停条约论文推荐理由:这篇论文戳穿了AI暂停条约的技术漏洞——分布式训练让监管形同虚设,做AI治理、安全研究的团队值得细看,看完会对现有方案的有效性重新评估。原文
14:39arXiv cs.LG@Ruitao Liu, Xinyang Tian, Shuo Chen, Tingrui Zhang, Guang Yang, Alan Zhao, Wei Xu精选论文提出 RRFP(Runtime-Readiness-First Pipeline),一种基于任务就绪状态的流水线并行运行时系统。传统流水线并行依赖静态或自适应生成的调度顺序,当实际任务就绪状态与预设顺序不一致时,会导致阶段错位和空闲气泡。RRFP 将调度视为非绑定的提示顺序,优先执行已就绪的任务,结合消息驱动的异步通信和轻量级张量并行协调。在 128 GPU 上测试,RRFP 在纯语言和多模态任务上分别实现最高 1.77 倍和 2.77 倍加速,并优于现有外部系统。论文流水线并行分布式训练大模型运行时优化RRFP推荐理由:大模型训练中流水线并行的空闲气泡问题一直困扰着分布式训练团队,RRFP 用就绪优先的思路直接提升 GPU 利用率,做大规模训练的工程师值得关注这个新方案。原文
10:36arXiv cs.LG@Yishun Lu, Junhao Zhang, Zeyu Yang, Wes Armour精选72°二阶优化方法能提升大模型训练效率,但计算和存储开销大。Asteria 是一个运行时系统,通过将优化器状态动态分配到 GPU、CPU 和 NVMe 存储,并异步执行逆根计算,解决了这一瓶颈。在单 GPU 的 DGX Spark 上,它支持 1B 参数模型的二阶训练;在多节点 GH200 系统上,它降低了 7B 模型的开销和延迟,加速收敛。研究表明,二阶优化实用化的关键在于运行时层面的状态管理和同步。论文大模型训练二阶优化运行时系统分布式训练Asteria推荐理由:Asteria 让二阶优化从理论走向实用,做大模型训练的团队可以大幅降低显存压力,同时保持收敛速度优势,值得关注其开源进展。原文
01:10DeepSeek: GitHub 新仓库(资讯)75°DeepSeek 开源了 DeepEP,这是首个专为 MoE(混合专家)模型设计的专家并行(EP)通信库。它提供了高吞吐、低延迟的 GPU 内核,支持训练和推理中的全到全通信。DeepEP 还支持低精度操作,如 FP8,并引入了高效的稀疏通信技术。该库已开源在 GitHub 上,开发者可以访问其 Pull Requests 页面了解更多。AI模型DeepSeekMoEEP通信库开源/仓库分布式训练推荐理由:MoE 模型的通信瓶颈一直是训练和推理的痛点,DeepEP 专为此优化,做大规模分布式训练的团队值得关注。原文
00:33Google Developers Blog(博客/媒体)TorchTPU是Google为TPU打造的原生PyTorch运行栈,旨在最小代码改动下实现高性能分布式训练。它采用“Eager First”模式,并利用XLA编译器优化集群训练。项目计划在2026年进一步降低编译开销,支持动态形状和自定义内核,以支持下一代AI模型的扩展。AI产品TPUPyTorchXLA编译器分布式训练Google推荐理由:TorchTPU让PyTorch用户能够更顺畅地迁移到TPU,同时保持Eager模式体验,这对需要TPU算力的大规模AI训练场景有直接价值。原文
00:33DeepSeek: GitHub 新仓库(资讯)70°DeepSeek 的 GitHub 组织页展示了其多个关键开源项目,包括高效FP8内核DeepGEMM、面向AI训练和推理的高性能分布式文件系统3FS、多头部隐式注意力内核FlashMLA、专家并行通信库DeepEP,以及用于V3/R1训练的双向流水线并行算法DualPipe等。这些仓库总计获得数万星标,反映了社区对DeepSeek技术栈的高度关注。此次页面加载存在部分错误,但不影响对核心开源成果的概览。AI模型开源/仓库推理模型基础设施分布式训练DeepGEMM推荐理由:DeepSeek 的开源仓库是其技术实力的集中体现,覆盖了从底层计算内核到分布式训练框架的全链路优化,对追求高效AI基础设施的开发者有重要参考价值。原文