10:56官方账号arXiv cs.LG@Ali Janati, Kaoutar El Maghraoui, Andrei Kanavalau, Anass Belfatmi论文报告,Muon优化器训练Transformer解(a+b) mod 113时,虽比AdamW更快grok,但9种配置均在后grokking阶段失去泛化,5个种子中有4个的AdamW参考准确率跌到27.59%。梯度降到10^-6后,Muon的步长弹性为-0.03,AdamW为+1.5,Muon组每参数移动快8.0倍。冻结嵌入/读出层可消除崩溃:451,400步和5个配对种子中,未冻结组出现137-321次低于阈值评估,冻结组为零。傅里叶滤波显示掩蔽场景下任务对齐族单独达100%,完整模型仅45.85%,重新缩放可恢复99.9%。论文MuonAdamWgrokking推荐理由:Muon grok虽快,后grokking会崩到27.59%;冻结embedding/readout就能稳。想用Muon训Transformer的注意。原文稍后读已读值得跟进有用关注 Muon
12:12官方账号arXiv cs.LG@Srinivasa Rao P., Vangmayi P Reddy该论文提出统一框架,连接信息论、拓扑和统计力学,解释深度学习的泛化极限。核心是熵可学习性界限(ELH),规定网络仅当数据流形香农熵超过决策边界拓扑熵且平衡网络权重的冯·诺依曼熵时才能学习。作者证明香农-拓扑瓶颈定理,表明超过此界限时系统进入信息挫折的玻璃态记忆阶段,泛化变得热力学不可能。他们发现grokking现象实质是熵释放,权重突然重组解锁瓶颈。论文还提出熵梯度下降(EGD)算法,动态管理权重熵以保持学习轨道。论文深度学习理论信息论泛化推荐理由:这篇论文用熵来解释深度学习泛化的硬极限和grokking,还给了EGD优化算法,理论研究者可以看看。原文稍后读已读值得跟进有用关注 深度学习理论