CIPHER-MoE:万亿参数 MoE 训练负载均衡新方法
训练万亿参数 MoE 模型的负载不均问题有了新解法,DeepSeek-V4-Pro 上实测训练加速最高 1.94 倍,还不用加硬件,做训练的可以看看。
训练万亿参数 MoE 模型的负载不均问题有了新解法,DeepSeek-V4-Pro 上实测训练加速最高 1.94 倍,还不用加硬件,做训练的可以看看。
Deven Pzak 把 NanoGPT 训练干到 39.9 秒,思路不是堆算力而是按 flop 精打细算,嵌入参数撒到 65B 还只用 124M 活跃参数,搞训练的都该看看。
长上下文训练一直是显存大户,Untied Ulysses 让单节点就能跑 3M token,做 LLM 训练和推理优化的团队值得关注,能省下不少 GPU 预算。
做LLM强化学习训练的团队终于有了一个能省算力又提效果的方法——ESPO在数学推理任务上不仅性能更好,还省了20%的token,训练成本敏感的团队值得一试。