论文精选

Muon优化器的哈密顿概率梯度流视角

Move on Muon : A Hamiltonian probability gradient flow perspective of Muon optimizer

精选理由

这篇论文为Muon优化器提供了严格的数学基础,揭示了其与哈密顿动力学的深层联系。对优化理论研究者或想深入理解Muon工作机制的深度学习从业者,值得细读。

AI 摘要

本文从概率梯度流的角度重新审视了Muon优化器,将其视为一种正则化的镜像/近端步骤。作者发现正则化的正交化映射是核范数的光滑Fenchel对偶平滑的梯度,从而将Muon更新与动量作为对偶坐标联系起来。通过将Muon从单矩阵参数提升到有限粒子概率目标,推导出惯性连续时间极限,并建立了相空间平均场方程。该流被证明是一种阻尼哈密顿概率动力学,其哈密顿能量单调递减。在额外假设下,论文证明了目标间隙的指数收敛速率,并研究了平均场极限方程的适定性和传播混沌保证。最后,将公式扩展到希尔伯特值特征映射,得到适用于平滑Transformer混合专家模型的块状Muon概率流。

AI 翻译 · 中文

本文从概率梯度流的角度重新审视了Muon优化器,将其视为一种正则化的镜像/近端步骤。作者发现正则化的正交化映射是核范数的光滑Fenchel对偶平滑的梯度,从而将Muon更新与动量作为对偶坐标联系起来。通过将Muon从单矩阵参数提升到有限粒子概率目标,推导出惯性连续时间极限,并建立了相空间平均场方程。该流被证明是一种阻尼哈密顿概率动力学,其哈密顿能量单调递减。在额外假设下,论文证明了目标间隙的指数收敛速率,并研究了平均场极限方程的适定性和传播混沌保证。最后,将公式扩展到希尔伯特值特征映射,得到适用于平滑Transformer混合专家模型的块状Muon概率流。

arXiv cs.LGWe develop a gradient flow on the space of probability measures defined on matrix-valued parameters induced by regularized Muon, an analytically smoothed version of the idealized Muon optimizer. The key observation is th