12:28官方一手arXiv: DeepSeek@Masato Fujitake论文提出 MESH,一种用于 MoE 专家层的隐藏动量 Sinkhorn 更新。在 110M 参数 DeepSeek 风格 MoE 预训练中,SAGE/Sinkhorn 混合把优化器状态从 0.883GB 降到 0.331GB,但评估损失 3.8265,差于 AdamW 基线的 3.58-3.64。MESH 在梯度缓冲区生命周期内恢复一阶矩信号,且不将专家一阶矩存入优化器状态。两个额外种子中,MESH 和 MESH-B 相对 AdamW 减少 62.5% 优化器状态内存,峰值 CUDA 分配下降约 12.6%,评估损失差距较小。论文MESHSinkhorn混合专家模型推荐理由:MoE 训练显存吃紧?MESH 方法砍掉六成优化器内存,损失只差一点,做大规模训练的可以试试。原文稍后读已读值得跟进有用关注 MESH