7月1日
11:04
11:04官方账号arXiv cs.LG@Zijian Liu
精选
一篇论文证明了 Random Reshuffling(RR)在光滑凸优化中,对于任意合理的步长和有限轮次,其收敛速度均严格优于标准 SGD。此前理论认为 RR 的步长需小于 1/n 阈值才能收敛,导致其最优理论速率低于 SGD。新结果首次从数学上解决了这一长期悬而未决的问题。
推荐理由:这篇论文终于从理论上证明了机器学习中常用的 Random Reshuffling 比经典 SGD 强,对优化算法感兴趣的朋友值得一看。
6月30日
11:05
11:05官方账号arXiv cs.LG@Marcelina Marjankowska, Valerio Modugno, Paolo Barucca
该论文研究训练过程中Hessian矩阵领先特征向量的动态演化。作者在多层感知机分类任务上,通过位移和逆参与率两个统计量跟踪特征向量变化。结果显示SGD训练下曲率方向逐渐趋于稳定,而Adam则持续重组特征向量。Adam还表现出局部化现象,少量参数主导领先曲率方向。这些发现揭示了优化器差异对训练轨迹的影响。
推荐理由:这篇论文分析了SGD和Adam训练中Hessian特征向量的不同行为,发现Adam会让少量参数主导曲率方向,直观解释了为什么两种优化器训练结果不同。
6月18日
10:43
10:43官方账号arXiv cs.AI@Depen Morwani, Alexandru Meterez, Pranav Nair, Sham Kakade
精选
该论文研究了随机重球法(HB)和加速SGD(ASGD)在一致线性回归中的计算效率与串行运行时间权衡。结果表明HB在任意谱下无法超越SGD的计算效率前沿,但允许在比SGD临界批量大sqrtκ倍的窗口内减少串行运行时间。ASGD在快速衰减幂律谱下可提升小批量计算效率,但随着批量增大,牺牲效率换取更优串行时间。合成线性回归实验验证了这些定性规律。
推荐理由:这篇论文把HB和ASGD在批量大小上的效率权衡讲清楚了,特别是那个sqrtκ倍的窗口,对想用动量方法加速训练的人很有参考价值。