全部 AI 动态 · AI 热点

6月23日

13:15

13:15

arXiv cs.AI@Dingzhi Yu, Hongyi Tao, Yuanyu Wan, Luo Luo, Lijun Zhang

AdamW是训练大型语言模型的默认优化器，但其理论主要建立在有限方差假设上。实证发现LLM预训练中的随机梯度噪声通常是重尾的。近期Lion、Muon等符号优化器已取得重尾收敛率，AdaGrad也能在重尾噪声下收敛。本文提出一个开放问题：AdamW能否在相同重尾假设下收敛？作者证明了一个正加权度量基准，并通过走廊下界机制表明分母记忆可能隐藏大梯度。

论文 AdamW LLM 重尾噪声优化器理论

推荐理由：AdamW天天用但理论有坑，这篇论文把收敛性列为开放问题，还给出了新分析框架。做LLM训练优化的人该看看。

10:34

10:34

arXiv cs.LG@Shengchao Zhao, Yongchao Liu

论文提出VRA-FedSGD算法，针对联邦学习中重尾梯度噪声和通信噪声问题。该算法采用动量方差缩减配合非线性映射减轻重尾梯度噪声，并使用方差缩减聚合机制抑制重尾通信噪声。在非凸目标函数下，均方收敛率为O(K^{-(p-1)/(2p-1)})，其中p为尾指数；在强凸目标函数下，几乎必然收敛率为O~(K^{-(1-1/(p-ε))})。在逻辑回归问题上的仿真实验验证了算法有效性。

论文 VRA-FedSGD 联邦学习方差缩减重尾噪声非凸优化

推荐理由：这篇论文搞了个VRA-FedSGD，专门对付联邦学习里常见的重尾噪声，收敛速度有理论保证，实验也跑通了，值得看看。

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

5月19日

14:49

14:49

arXiv cs.LG@Zijian Liu

精选

现代机器学习优化中常出现重尾梯度噪声，传统方法需梯度裁剪或归一化来保证收敛。本文首次证明 AdaGrad（自适应梯度方法的起源）在非凸优化中，当尾指数 p 满足 4/3 < p ≤ 2 时无需任何算法修改即可收敛，且无需预先知道 p 值。研究还给出了算法相关的下界，表明 AdaGrad 无法达到重尾优化的最优 minimax 速率。对于 AdaGrad-Norm 变体，在额外温和假设下，收敛率可推广到任意 1 < p ≤ 2。

论文 AdaGrad 重尾噪声收敛性分析非凸优化自适应梯度方法

推荐理由：理论研究者终于有了 AdaGrad 在重尾噪声下的收敛保证，做优化算法分析的人值得关注——它解释了为何 Adam 等自适应方法在真实场景中表现稳健，且无需额外操作。