11:48官方账号arXiv cs.LG@Devender Singh论文研究矩阵分解模型 W=UV^T 下不同优化器的隐式偏置。梯度下降、动量、共享标量Adam、Muon、Shampoo具有规范等变性,Adam和RMSProp等坐标级方法不具备,因此后者无法继承低秩偏置。结构定理刻画了无记忆等变规则等价于Gram决定的左预条件,传递定理把梯度流的路径性质推广到公共标量流。在欠定矩阵感知的9种更新规则实验中,从坐标级到共享标量预条件的单参数族单调恢复偏置,说明各向异性是主因。Transformer实验中,Adam第一步就让两个规范等价初始化分离,最终 W_Q^T W_K 的相对Frobenius距离相差56%。高光谱数据集在匹配训练损失下,梯度下降在最低采样密度时将留出误差降低43-44%。论文AdamMuon优化器推荐理由:这篇论文证明了Adam没有梯度下降的低秩隐式偏置,在Transformer里能让等价初始化差56%,不是调参小事。原文稍后读已读值得跟进有用关注 Adam