11:32官方账号arXiv cs.LG@Maria Smirnova, Alexey Kravatskiy论文提出 SignMuon,将 Muon 优化器的更新逐参数取符号压缩为 1 bit。在 CIFAR-10 与 nanoGPT speedrun 实验中,SignMuon 优于 SignSGD,但作者构造线性函数实例证明它可能上升。把符号操作放在线性最小化 Oracle 之前或两侧同样无法保证下降。误差反馈用在 Muon 输出上对所有平滑常数、步长和动量都可能失效;用在梯度上则有效,EF21-MuonSign 在光滑非凸问题上达到 O(T^{-1/2}) 平方梯度范数收敛率。实验里最强的压缩方法是符号放在 Oracle 之后,尽管该配置理论上发散。论文MuonSignMuon误差反馈推荐理由:把 Muon 更新压成每参数 1 bit 的符号,实验里 sign-after-LMO 最强,尽管理论上会发散,结论很反直觉。原文稍后读已读值得跟进有用关注 Muon
10:09官方账号arXiv cs.LG@Daniel Berg Thomsen, Adrien Taylor, Aymeric Dieuleveut该论文针对分布式学习中通信瓶颈问题,对两种主流误差反馈算法(EF和EF21)进行了紧致收敛性分析。通过识别最优步长选择和构建最优Lyapunov函数,作者证明了这些算法在任意数量智能体下的收敛保证,并恢复了单智能体场景下已知的最佳结果。这项研究为理解误差反馈机制在分布式优化中的性能提供了理论基础,有助于设计更高效的通信压缩策略。论文分布式优化误差反馈通信压缩推荐理由:做分布式机器学习或联邦学习的开发者,这篇论文给出了误差反馈算法的理论极限,帮你理解通信压缩到底能省多少而不损失收敛性,值得细读。原文稍后读已读值得跟进有用关注 分布式优化