研究证明带梯度裁剪的去中心化 SGD 在重尾噪声下可达到最优收敛率
搞分布式训练的可以看看这篇:它证明了裁剪过的去中心化 SGD 在重尾噪声下收敛率最优,还首次给出了线性加速证明,并解释了为什么裁剪比归一化更适合去中心化场景。
搞分布式训练的可以看看这篇:它证明了裁剪过的去中心化 SGD 在重尾噪声下收敛率最优,还首次给出了线性加速证明,并解释了为什么裁剪比归一化更适合去中心化场景。
去中心化学习研究者终于有了理论最优的随机算法——MG-ADSGD同时加速了条件数和网络拓扑的影响,做分布式优化或联邦学习的团队值得关注这个新基准。