一位 AI 研究者靠每天发一条推文涨到 30 万粉丝,他分享的内容包括 nanoGPT 和 Muon 等项目,想学做技术自媒体的可以看看他的路子。
#Muon
Deven Pzak 把 NanoGPT 训练干到 39.9 秒,思路不是堆算力而是按 flop 精打细算,嵌入参数撒到 65B 还只用 124M 活跃参数,搞训练的都该看看。
把 Muon 里那套 Newton-Schulz 迭代搬到注意力输出上,不加参数,ViT 和 Swin 在 CIFAR 上 12 组对比全涨,代价是推理变慢一点。
Muon grok虽快,后grokking会崩到27.59%;冻结embedding/readout就能稳。想用Muon训Transformer的注意。
Muon在矩阵优化里挺火,但上Stiefel流形一直靠近似。这篇论文给了精确闭式解,还做了个Skewon,收敛性有保障,做正交约束优化的值得看。
Muon优化器之前都在Transformer上测试,这篇论文把它用到Mamba-2 130M上,发现输出投影用Muon最划算,训练效率更高,值得看看。
写了个新优化器CMuon,训练扩散Transformer比AdamW快两倍多,675M模型200轮就跑到FID 1.18,厉害得很。
把 Muon 更新压成每参数 1 bit 的符号,实验里 sign-after-LMO 最强,尽管理论上会发散,结论很反直觉。
NVIDIA找到AdamW的短板了,批量干到1亿tokens它就崩,但SOAP和Muon依然稳,还解决了训练崩溃的毛病,训大模型可以看看这个。
这篇论文用Muon优化器颠覆了'异步流水线并行梯度延迟必然拉胯训练'的老观念,10B参数实验证明性能和同步训练一样好,做大型LLM预训练的同学应该看看。
这篇论文提出了一种简单通用的优化器改进方案,能解耦权重幅度和方向,消除权重衰减和warmup,在Adam和Muon上都有效,值得关注。
做LLM训练或优化器研究的团队,这篇论文把Muon动量从玄学变成了可解释的频谱滤波机制,看完能直接指导你调参——先降噪再正交化,效果更稳。
这篇论文解决了优化器几何结构固定、无法适应问题几何的问题,做深度学习训练和优化器研究的开发者可以直接参考其自适应方法,有望提升模型训练效率。
分布式训练团队终于有了异步 LMO 方法的理论保障——Ringmaster LMO 解决了异构集群中慢节点拖累效率的问题,做大规模预训练或异构系统优化的开发者值得关注。