AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

模块化加法

共 1 条相关 AI 资讯
8月10日
10:56
10:56官方账号arXiv cs.LG@Ali Janati, Kaoutar El Maghraoui, Andrei Kanavalau, Anass Belfatmi
论文报告,Muon优化器训练Transformer解(a+b) mod 113时,虽比AdamW更快grok,但9种配置均在后grokking阶段失去泛化,5个种子中有4个的AdamW参考准确率跌到27.59%。梯度降到10^-6后,Muon的步长弹性为-0.03,AdamW为+1.5,Muon组每参数移动快8.0倍。冻结嵌入/读出层可消除崩溃:451,400步和5个配对种子中,未冻结组出现137-321次低于阈值评估,冻结组为零。傅里叶滤波显示掩蔽场景下任务对齐族单独达100%,完整模型仅45.85%,重新缩放可恢复99.9%。
论文MuonAdamWgrokking

推荐理由:Muon grok虽快,后grokking会崩到27.59%;冻结embedding/readout就能稳。想用Muon训Transformer的注意。
原文
精选全部日报登录