研究证明带梯度裁剪的去中心化 SGD 在重尾噪声下可达到最优收敛率
搞分布式训练的可以看看这篇:它证明了裁剪过的去中心化 SGD 在重尾噪声下收敛率最优,还首次给出了线性加速证明,并解释了为什么裁剪比归一化更适合去中心化场景。
搞分布式训练的可以看看这篇:它证明了裁剪过的去中心化 SGD 在重尾噪声下收敛率最优,还首次给出了线性加速证明,并解释了为什么裁剪比归一化更适合去中心化场景。
这篇论文终于从理论上证明了机器学习中常用的 Random Reshuffling 比经典 SGD 强,对优化算法感兴趣的朋友值得一看。
这篇论文分析了SGD和Adam训练中Hessian特征向量的不同行为,发现Adam会让少量参数主导曲率方向,直观解释了为什么两种优化器训练结果不同。
做深度学习训练调参的开发者,这个动态p范数方案解决了ℓ₂和ℓ∞范数的极端问题,直接替换SGD就能提升泛化,值得在CIFAR/ImageNet任务上试试。
这篇论文解决了优化器几何结构固定、无法适应问题几何的问题,做深度学习训练和优化器研究的开发者可以直接参考其自适应方法,有望提升模型训练效率。