01:31官方账号Cursor@cursor_ai72°Cursor AI 开源了 Mixture-of-Kittens (MoK) 训练内核。该内核面向 NVIDIA NVL72 平台,将全部 MoE 通信与计算融合为单个确定性内核。相比最强公开基线,MoK 的训练速度最高可提升 2.37 倍。开发者现在可以获得完整代码并用于自己的训练任务。AI产品CursorMoKNVL7210 个信源在谈事件专题推荐理由:Cursor 把 NVL72 上的 MoE 训练内核开出来了,比公开方案快 2.37 倍,想省训练成本直接用。原文稍后读已读值得跟进有用关注 Cursor
09:28官方账号arXiv cs.LG@Qian Tan, Huaifei Liang, Xuanyu Zhu, Lei Jiang, Yuqiang Li在线蒸馏(OPD)沿学生生成轨迹提供密集教师监督,但长响应会拖慢批量完成。现有加速方法用固定预算或绝对师生一致阈值控制回滚长度,难以反映学习进度。Adaptive FastOPD 仅在当前边界区域学习趋于平稳且视野利用充分时扩展回滚视野,由四个师生信号相对值判断进度。在两个师生对上,Adaptive FastOPD 比 OPD 15K 减少训练时间 49.1%–71.2%,同时取得最高平均性能,且对超参数设置鲁棒。论文Adaptive FastOPDOPD在线蒸馏推荐理由:发了个叫Adaptive FastOPD的蒸馏加速方法,比OPD 15K快一半多,性能还更高。做训练加速的可以看看。原文稍后读已读值得跟进有用关注 Adaptive FastOPD
01:12官方账号NVIDIA AI@NVIDIAAI76°NVIDIA 发布了 NeMo AutoModel,基于 Hugging Face Transformers v5 为混合专家 (MoE) 模型提供原生支持。通过 Expert Parallelism、DeepEP 和 TransformerEngine 内核,仅需几行代码即可应用优化。实测显示 NeMo AutoModel 将主流 MoE 模型训练吞吐量提升 3.4 到 3.7 倍。该工具是 NeMo 框架的一部分,专为大规模模型构建设计。AI产品NeMo AutoModelMoEHugging Face Transformers v57 个信源在谈事件专题推荐理由:NVIDIA 出了个 NeMo AutoModel,基于 Hugging Face Transformers v5,几行代码就能给 MoE 模型训练加速 3 倍以上,搞大模型训练的值得看看。原文稍后读已读值得跟进有用关注 NeMo AutoModel
08:05官方账号NVIDIA AI@NVIDIAAI精选72°NVIDIA 在 Blackwell 平台上使用 NVFP4 精度训练了 Llama 3 8B 和 405B 模型。实验结果显示,相比 FP8 精度,NVFP4 实现了 1.31 到 1.73 倍的训练速度提升,且未出现任何精度损失。这一突破意味着大模型训练可以在更短的时间内完成,同时保持模型质量。对于需要大规模训练 AI 模型的团队来说,这能显著降低计算成本和等待时间。AI模型NVIDIABlackwellNVFP44 个信源在谈事件专题推荐理由:训练速度提升 1.3-1.7 倍且零精度损失,做大规模模型训练的团队可以直接在 Blackwell 上尝试 NVFP4,省时省成本。原文稍后读已读值得跟进有用关注 NVIDIA
19:58rohanpaul_ai@rohanpaul_ai研究发现图像扩散Transformer训练效率低下的根源在于残差连接,而非注意力或编码器。残差连接导致信号膨胀、梯度消失和特征冗余,尤其不适合扩散模型这种多步去噪任务。作者提出扩散自适应路由(Diffusion-Adaptive Routing),让每层根据去噪时间步动态选择前层输出,从而在相同图像质量下减少8.75倍训练迭代。该工作没有引入新数据集或注意力机制,而是质疑了从语言Transformer继承的残差结构。论文扩散模型Transformer残差连接推荐理由:扩散模型研究者终于找到了训练瓶颈的隐藏位置——残差连接,8.75倍加速意味着更低的训练成本,做图像生成的团队值得关注这个新路由方案。原文稍后读已读值得跟进有用关注 扩散模型
09:46官方账号arXiv cs.AI@John-Joseph Brady, Nikolas Nusken, Yunpeng Li精选深度状态空间模型(DSSM)在统计建模中广泛应用,但大规模训练一直困难。现有方法分为两类:自编码DSSM通过优化变分下界训练生成模型,而基于序贯蒙特卡洛(SMC)的方法可处理判别与生成任务,但因前向过程的顺序性在GPU上扩展性差。研究者提出并行变分蒙特卡洛(PVMC)方法,融合两类范式优势,在基准实验中达到或超越当前最优结果,且训练速度比最快的SMC方法快10倍。该方法可稳健训练DSSM用于判别和生成任务,解决了SMC方法在硬件上的扩展瓶颈。论文深度状态空间模型并行变分蒙特卡洛训练加速推荐理由:做时间序列建模或状态空间模型研究的团队,PVMC让训练速度提升10倍且不牺牲精度,值得直接尝试。原文稍后读已读值得跟进有用关注 深度状态空间模型
01:23berryxia@berryxia精选Duke大学团队提出REPR-ALIGN方法,通过将扩散语言模型(DLM)的隐藏状态对齐到预训练自回归语言模型(AR LM)的表示空间,避免从零训练DLM的高成本。该方法仅修改注意力掩码,不增加适配器或改变架构,在低数据场景下效果显著,训练速度最高提升4倍。论文指出DLM只需学习解码路径,无需重新学习语言表示。相关论文和代码已开源。论文扩散语言模型DLMREPR-ALIGN推荐理由:做扩散模型或生成式AI的团队,终于不用从零训DLM了——对齐预训练AR模型就能省4倍训练成本,低数据场景尤其划算,建议直接看论文和代码。原文稍后读已读值得跟进有用关注 扩散语言模型
00:33官方一手Google Developers Blog(博客/媒体)Google Cloud推出新集成方案,通过fsspec接口将Rapid Storage与PyTorch直连,利用Colossus架构和双向gRPC流,实现最高15 TiB/s聚合吞吐量并显著降低延迟。开发者只需更新存储桶类型,无需修改代码即可使训练总时间缩短23%。该方案旨在消除AI训练中的数据加载瓶颈,提升大规模分布式训练效率。AI产品PyTorchGoogle Cloud存储优化推荐理由:对于依赖PyTorch进行大规模AI训练的团队,该方案提供了零代码改动的性能提升路径,验证了存储系统优化对训练效率的显著影响。原文稍后读已读值得跟进有用关注 PyTorch
14:00官方一手OpenAI Blog(博客/媒体)精选本文提出权重归一化(Weight normalization),一种通过重参数化权重向量来加速深度神经网络训练的简单技术。该方法将权重向量分解为方向向量和标量长度,并分别使用SGD优化,类似于Batch normalization的效果但计算开销更低。在MNIST、CIFAR-10等标准基准上,Weight normalization使网络收敛速度提升2-5倍,并能稳定训练极深网络(如100层ResNet)。实验表明,该方法与ReLU、Dropout等常用技术兼容,无需引入额外依赖。论文Weight normalization重参数化训练加速推荐理由:用简单重参数化加速训练,效果堪比BN但更轻量原文稍后读已读值得跟进有用关注 Weight normalization