#优化器
Muon优化器之前都在Transformer上测试,这篇论文把它用到Mamba-2 130M上,发现输出投影用Muon最划算,训练效率更高,值得看看。
把 Muon 更新压成每参数 1 bit 的符号,实验里 sign-after-LMO 最强,尽管理论上会发散,结论很反直觉。
这篇论文分析了SGD和Adam训练中Hessian特征向量的不同行为,发现Adam会让少量参数主导曲率方向,直观解释了为什么两种优化器训练结果不同。
这篇论文提出了一种简单通用的优化器改进方案,能解耦权重幅度和方向,消除权重衰减和warmup,在Adam和Muon上都有效,值得关注。
想加速Transformer预训练?这篇论文把优化器角度步长显式化,新方法AngularMuown在nanoGPT竞赛中领先,还在0.5B和1.1B模型上验证了效果。
量子机器学习团队终于有了一个能大幅降低测量成本的梯度估计框架——QUIVER在60量子比特规模上效率提升数个数量级,做量子电路优化的研究者可以直接用。
DoPr 解决了训练和部署性能不一致的痛点,做自回归模型、流生成或机器人学习的团队可以直接尝试这个即插即用优化器,可能会发现验证损失没变但实际效果提升。
做AI Agent开发的团队常手工写技能文档但效果有限,SkillOpt用优化器自动迭代技能文件,零推理开销且效果显著,值得尝试。
做LLM训练或优化器研究的团队,这篇论文把Muon动量从玄学变成了可解释的频谱滤波机制,看完能直接指导你调参——先降噪再正交化,效果更稳。
做深度学习训练调参的开发者,这个动态p范数方案解决了ℓ₂和ℓ∞范数的极端问题,直接替换SGD就能提升泛化,值得在CIFAR/ImageNet任务上试试。
这篇论文解决了优化器几何结构固定、无法适应问题几何的问题,做深度学习训练和优化器研究的开发者可以直接参考其自适应方法,有望提升模型训练效率。