09:29官方账号arXiv cs.LG@Xiaotian Zhang, Lai Shun Chan, Yue Shang, Entao Yang, Ge Zhang一篇来自arXiv的论文研究了高熵解对模型鲁棒性的影响。作者以模算术中的grokking为受控场景,对比AdamW训练的Transformer与基于Wang-Landau分子动力学采样的高熵模型。噪声注入实验显示,AdamW模型在强制记忆随机标签后,原任务测试准确率从100%跌至75%以下,而高熵模型仍保持约95%。通过奇异值分解发现,高熵网络在注意力层和MLP层具有更高的有效秩,可缓冲灾难性遗忘。论文GrokkingAdamWWang-Landau推荐理由:这篇论文用模算术实验揭穿了一个幻觉:模型泛化好不代表扛得住后续干扰。高熵模型比AdamW更抗遗忘,想了解训练鲁棒性的可以看看。原文稍后读已读值得跟进有用关注 Grokking
09:08官方账号arXiv cs.LG@Gunner Levi Howe该论文通过188次新实验研究了表征先验在Grokking中的作用。错误特征族(幅度带)像随机划分一样阻止泛化(1/15 vs 0/20 grok,p=0.43)。完全无标签的不变性先验(仅交换对)在15/15次运行中泛化,中位加速2.7倍,且比标签监督先验更可靠(p=0.038)。早期窗口(前2000个epoch,占4%预算)即可实现10/10泛化及2.7倍加速,优于连续应用(8/10,1.25倍)和后期窗口(2.1倍)。结合权重范数钳制的先验达到中位17倍加速(5/5),而普通交叉熵仅在精确临界范数下才匹配此速度。论文Grokking表征先验无标签不变性推荐理由:这篇论文搞清了Grokking延迟的可控关键:用无标签特征族先验就能加速17倍,而且只在训练早期用一小会儿就够,比你想的简单实用。原文稍后读已读值得跟进有用关注 Grokking
10:32官方账号arXiv cs.AI@Srijan Tiwari, Aditya Chauhan, Manjot Singh该论文对神经网络在算法任务上的延迟泛化(grokking)现象进行几何分析,发现交叉熵优化下隐藏表示的径向膨胀是延迟的主因。作者提出径向-角分解并推导三个可检验命题,引入单一超参数范数惩罚将激活约束在 sqrt(d) 半径超球面上。在模算术任务上,该惩罚使 MLPs 和 Transformers 的 grokking 加速高达 6 倍;对 10M 参数的 nanoGPT 在 3 位数加法上训练步数减半。论文Grokking泛化几何分析推荐理由:这篇论文用几何视角解释了神经网络为什么先死记硬背后突然泛化,还找到了一个简单技巧(约束隐藏层半径)让 grokking 快 6 倍,值得搞训练的人看看。原文稍后读已读值得跟进有用关注 Grokking