研究证明带梯度裁剪的去中心化 SGD 在重尾噪声下可达到最优收敛率
搞分布式训练的可以看看这篇:它证明了裁剪过的去中心化 SGD 在重尾噪声下收敛率最优,还首次给出了线性加速证明,并解释了为什么裁剪比归一化更适合去中心化场景。
搞分布式训练的可以看看这篇:它证明了裁剪过的去中心化 SGD 在重尾噪声下收敛率最优,还首次给出了线性加速证明,并解释了为什么裁剪比归一化更适合去中心化场景。
理论研究者终于有了 AdaGrad 在重尾噪声下的收敛保证,做优化算法分析的人值得关注——它解释了为何 Adam 等自适应方法在真实场景中表现稳健,且无需额外操作。